Как настроить автоматический перевод с помощью LLM
Практическое руководство по настройке автоматического перевода документов и текстов через языковые модели.
Проверено 20 июля 2026 года. Автоматический перевод через LLM строится как конвейер: текст делят на устойчивые сегменты, к каждому применяют глоссарий, переводят в заданном формате, проверяют плейсхолдеры и числа, повторяют только ошибочные сегменты и собирают документ. Для юридического, медицинского и публичного текста результат остаётся черновиком до проверки специалистом.

Рабочий конвейер перевода
| Шаг | Вход | Проверка |
|---|---|---|
| Segment | Документ | Не разорваны список, таблица, предложение и плейсхолдер |
| Glossary | Термины и запрещённые переводы | Каждый ключевой термин имеет один целевой вариант |
| Translate | Сегмент, контекст и правила | Модель возвращает только заданную структуру |
| Validate | Оригинал и перевод | Совпадают числа, ссылки, переменные и теги |
| Retry | Только ошибочные сегменты | Причина ошибки передана в повторный запрос |
| Export | Проверенные сегменты | Сохранены порядок и формат документа |
Фиксированный пример с глоссарием
Исходник: Deploy the agent to staging. Keep the {{account_id}} placeholder and the /health URL unchanged.
Глоссарий: agent = агент, staging = тестовый контур, deploy = развернуть.
Ожидаемый перевод: Разверните агента в тестовом контуре. Не изменяйте плейсхолдер {{account_id}} и адрес /health.
Автоматическая проверка должна обнаружить, если исчезли двойные фигурные скобки, изменился URL, потерялось предложение или термин переведён иначе. Стилистическую оценку отделяйте от формальных ошибок: плейсхолдер либо сохранён, либо нет.
Формат ответа и проверка
{
"segment_id": "42",
"translation": "Разверните агента в тестовом контуре...",
"used_terms": ["agent", "staging", "deploy"],
"warnings": []
}Проверяйте JSON обычным валидатором, а не вторым расплывчатым запросом. Затем сравните регулярными выражениями URL, переменные, числа и теги. LLM можно попросить найти смысловые пропуски, но окончательное решение для критичного текста принимает редактор.
Как посчитать цену для 100 тысяч знаков
API обычно тарифицирует токены, а не символы. Поэтому безопасный расчёт начинается с токенизации реального документа. Формула:
cost = input_tokens × input_rate / 1_000_000
+ output_tokens × output_rate / 1_000_000Добавьте системную инструкцию, глоссарий, повторные запросы и проверку. Для 100 тысяч знаков сначала измерьте input_tokens выбранным токенизатором, затем сделайте пробный перевод 1–5% текста и оцените отношение выходных токенов к входным. Подстановка «один токен равен N знакам» без измерения даёт ложную точность.
Таксономия ошибок
- Оmission: пропущено слово, предложение, пункт списка или примечание.
- Addition: в перевод добавлен факт, которого не было в оригинале.
- Terminology: нарушен глоссарий или один термин переведён по-разному.
- Format: повреждены JSON, Markdown, HTML, переменные, числа или ссылки.
- Meaning: грамматически гладкая фраза меняет смысл оригинала.
Частые вопросы
Нужно переводить документ целиком?
Большие документы лучше делить по смысловым границам и передавать соседний контекст отдельно. Иначе растут цена и риск повреждения формата.
Как сохранить HTML и Markdown?
Защитите теги и плейсхолдеры, запросите структурированный ответ и после перевода сравните служебные элементы программно.
LLM заменяет переводчика?
Для черновика и повторяемых материалов часто помогает. Юридические, медицинские, репутационные и художественные тексты требуют профильной проверки.
Как выбрать модель?
Сравните несколько моделей на одном наборе сегментов, глоссарии и типах ошибок. Тариф смотрите на официальной странице в день расчёта.
Источники и дата проверки
- Официальная карточка GPT-5.6 Luna.
- Сравнение моделей и текущих тарифов OpenAI.
- Официальная документация DeepL по глоссариям.