ИИ для ML-инженера в образовании: конструктор промптов
ML-инженер в образовании решает нетривиальные задачи: от прогнозирования успеваемости до адаптивной генерации учебных траекторий. Ключевой навык — умение формулировать запросы к LLM так, чтобы получать не «сырой текст», а структурированный код, синтетические данные или план эксперимента. Разберем анатомию эффективного промпта и дадим шаблоны.
Анатомия эффективного промпта
Промпт для ML-задачи должен содержать 5 обязательных блоков. Пропуск любого из них ведет к «галлюцинациям» модели.
- Роль и контекст: «Ты — senior ML-инженер с опытом в edtech».
- Задача и формат вывода: «Сгенерируй Python-код с использованием pandas и sklearn».
- Ограничения и метрики: «Без внешних зависимостей, целевая метрика — F1-score».
- Пример (few-shot): «Вот пример входных данных и ожидаемого результата».
- Критерии проверки: «Добавь docstring и обработку пропусков».
Правило: чем специфичнее ограничения, тем выше вероятность получить рабочий код с первого раза.
Шаблоны запросов с пояснением настройки
1. Генерация синтетических данных для датасета
Шаблон: «Сгенерируй 500 строк синтетических данных для задачи классификации студентов на группы риска. Признаки: посещаемость, время на платформе, баллы за тесты. Добавь шум и дисбаланс классов 80/20. Выведи код на Python с использованием numpy.random».
Настройка: меняйте тип дисбаланса (80/20, 95/5) и корреляцию признаков (указать: «сделай посещаемость сильно коррелирующей с баллами»).
2. Автоматическая генерация фич-инжиниринга
Шаблон: «Предложи 10 новых фич для датасета логов LMS (learning management system). Учитывай временные ряды и сезонность. Для каждой фичи дай SQL-запрос и обоснование».
Настройка: добавьте тип модели («для градиентного бустинга») или ограничение по времени («только фичи, которые можно посчитать за O(n)»).
3. Объяснение результатов модели (XAI)
Шаблон: «У меня есть модель RandomForest с accuracy 0.85. Дай интерпретацию SHAP-значений для конкретного студента. Напиши, какие 3 фичи повлияли на решение и почему. Формат: JSON с ключами feature, value, impact».
Настройка: укажите тип объяснения («для родителя студента» — без жаргона, или «для коллеги» — с математикой).
4. Построение пайплайна обучения
Шаблон: «Создай sklearn Pipeline для предобработки и обучения модели. Включи: OneHotEncoder, StandardScaler, LogisticRegression. Добавь GridSearchCV с 5-fold кросс-валидацией. Выведи полный код».
Настройка: замените модель на CatBoost или добавьте кастомный трансформер («напиши класс для удаления выбросов по IQR»).
Таблица настройки параметров промпта
| Параметр | Значение по умолчанию | Рекомендация для ML |
|---|---|---|
| Температура | 0.7 | 0.1–0.3 для кода, 0.8 для идей |
| Max tokens | 2048 | 4096 для полного кода |
| Top-p | 0.9 | 0.95 для креативных фич |
| Частота штрафа | 0 | 0.5 для уменьшения повторов |
Типичные ошибки
- Запрос без примера данных — модель генерирует абстрактный код.
- Игнорирование версии библиотек — указывайте «sklearn 1.3».
- Отсутствие обработки ошибок — добавьте «оберни в try/except».
Используйте конструктор как чек-лист: роль → задача → формат → ограничение → пример. Это сократит время итераций на 60%.