ИИ для лингвиста: глоссарий редактора машинного перевода
Работа лингвиста с машинным переводом (МП) требует владения новым инструментарием. Ниже — ключевые термины, которые превращают черновой вывод нейросети в качественный текст.
Базовые понятия
- Постредактирование (PE) — процесс исправления текста, сгенерированного МП, с целью достижения заданного уровня качества (полное или лёгкое). Пример: замена буквализма «to make a decision» → «принять решение» вместо «сделать решение».
- Галлюцинация (Hallucination) — уверенный, но фактически ложный или нерелевантный фрагмент в выходе модели. Пример: модель добавила несуществующую статистику в отчёт.
- Терминбаза (Termbase) — структурированный глоссарий, который принудительно подставляет утверждённые варианты перевода. Пример: «backend» всегда → «серверная часть», а не «задний конец».
Продвинутые инструменты
- Контекстное окно (Context Window) — объём текста (в токенах), который модель учитывает при генерации следующего фрагмента. Пример: окно в 8K токенов позволяет удерживать нить рассуждения на 2-3 абзаца.
- Few-shot промптинг — техника, когда лингвист даёт модели 2-3 примера «исходник → идеальный перевод» перед основным запросом. Пример: показать, как переводить идиомы, и модель скопирует стиль.
- Семантическое ядро (Semantic Core) — набор ключевых смысловых единиц, которые нельзя искажать при переводе. Пример: юридический термин «force majeure» требует точного соответствия «обстоятельства непреодолимой силы».
Совет: всегда проверяйте галлюцинации на фактических данных (даты, имена, цифры). Нейросеть не знает истину — она знает вероятность. Ваша экспертиза — фильтр реальности.
Сравнение подходов
| Метод | Скорость | Качество | Роль лингвиста |
|---|---|---|---|
| Сырой МП | Высокая | Низкое | Полное PE |
| МП + Терминбаза | Средняя | Среднее | Контроль терминов |
| МП + Few-shot | Средняя | Высокое | Настройка промптов |
Главный сдвиг: лингвист превращается из «переводчика» в «архитектора качества», управляя контекстом и ограничениями модели.