Как настроить автоматический перевод с помощью LLM

Практическое руководство по настройке автоматического перевода документов и текстов через языковые модели.

Автоматический перевод с LLM: настройка

Проверено 20 июля 2026 года. Автоматический перевод через LLM строится как конвейер: текст делят на устойчивые сегменты, к каждому применяют глоссарий, переводят в заданном формате, проверяют плейсхолдеры и числа, повторяют только ошибочные сегменты и собирают документ. Для юридического, медицинского и публичного текста результат остаётся черновиком до проверки специалистом.

Официальная карточка модели GPT-5.6 Luna с текущими тарифами API
Тарифы моделей меняются. Для расчёта используйте живую карточку выбранной модели и фактическое число токенов.

Рабочий конвейер перевода

ШагВходПроверка
SegmentДокументНе разорваны список, таблица, предложение и плейсхолдер
GlossaryТермины и запрещённые переводыКаждый ключевой термин имеет один целевой вариант
TranslateСегмент, контекст и правилаМодель возвращает только заданную структуру
ValidateОригинал и переводСовпадают числа, ссылки, переменные и теги
RetryТолько ошибочные сегментыПричина ошибки передана в повторный запрос
ExportПроверенные сегментыСохранены порядок и формат документа

Фиксированный пример с глоссарием

Исходник: Deploy the agent to staging. Keep the {{account_id}} placeholder and the /health URL unchanged.

Глоссарий: agent = агент, staging = тестовый контур, deploy = развернуть.

Ожидаемый перевод: Разверните агента в тестовом контуре. Не изменяйте плейсхолдер {{account_id}} и адрес /health.

Автоматическая проверка должна обнаружить, если исчезли двойные фигурные скобки, изменился URL, потерялось предложение или термин переведён иначе. Стилистическую оценку отделяйте от формальных ошибок: плейсхолдер либо сохранён, либо нет.

Формат ответа и проверка

{
  "segment_id": "42",
  "translation": "Разверните агента в тестовом контуре...",
  "used_terms": ["agent", "staging", "deploy"],
  "warnings": []
}

Проверяйте JSON обычным валидатором, а не вторым расплывчатым запросом. Затем сравните регулярными выражениями URL, переменные, числа и теги. LLM можно попросить найти смысловые пропуски, но окончательное решение для критичного текста принимает редактор.

Как посчитать цену для 100 тысяч знаков

API обычно тарифицирует токены, а не символы. Поэтому безопасный расчёт начинается с токенизации реального документа. Формула:

cost = input_tokens × input_rate / 1_000_000
     + output_tokens × output_rate / 1_000_000

Добавьте системную инструкцию, глоссарий, повторные запросы и проверку. Для 100 тысяч знаков сначала измерьте input_tokens выбранным токенизатором, затем сделайте пробный перевод 1–5% текста и оцените отношение выходных токенов к входным. Подстановка «один токен равен N знакам» без измерения даёт ложную точность.

Таксономия ошибок

  • Оmission: пропущено слово, предложение, пункт списка или примечание.
  • Addition: в перевод добавлен факт, которого не было в оригинале.
  • Terminology: нарушен глоссарий или один термин переведён по-разному.
  • Format: повреждены JSON, Markdown, HTML, переменные, числа или ссылки.
  • Meaning: грамматически гладкая фраза меняет смысл оригинала.

Частые вопросы

Нужно переводить документ целиком?

Большие документы лучше делить по смысловым границам и передавать соседний контекст отдельно. Иначе растут цена и риск повреждения формата.

Как сохранить HTML и Markdown?

Защитите теги и плейсхолдеры, запросите структурированный ответ и после перевода сравните служебные элементы программно.

LLM заменяет переводчика?

Для черновика и повторяемых материалов часто помогает. Юридические, медицинские, репутационные и художественные тексты требуют профильной проверки.

Как выбрать модель?

Сравните несколько моделей на одном наборе сегментов, глоссарии и типах ошибок. Тариф смотрите на официальной странице в день расчёта.

Источники и дата проверки

Связанные материалы

Сохранённые ссылки эксперимента

Telegram-канал @toolarium