Исходник — PDF на китайском. Задача — сделать русский мануал, по которому инженеры смогут реально работать: подключать модуль по UART/USB, настраивать прошивку и ловить колбеки.
В чем здесь реальная сложность?
1. Китайский язык очень компактный. Пару иероглифов при переводе превращаются в длинное предложение на русском. Текст расширяется примерно на 40%. Обычные переводчики в этот момент «взрывают» таблицы и кнопки — текст просто налезает друг на друга. 2. Текст внутри картинок. В мануале много схем плат и чертежей. Надписи там — это часть изображения, а не текст. Если просто скормить файл в GPT, он их проигнорирует. 3. Терминология. Тут нельзя переводить «в лоб». Нужно сохранить названия протоколов обмена, а специфические термины (типа *Liveness Detection*) перевести как «детекция живого лица», а не «обнаружение жизни».
Как решали задачу (Внутрянка)
Прогнали файл через наш стандартный пайплайн. Вот как это работает механически:
1. 👁 OCR и работа с графикой Наш парсер разобрал PDF на слои. Он нашел надписи, «вшитые» в картинки схем, распознал их и очистил место для вставки русского текста. Визуальные элементы (линии, контуры плат) остались нетронутыми.
2. 🤖 Перевод с контекстом (LLM + RAG) Чтобы нейросеть не несла отсебятину, мы подгрузили ей технический глоссарий. * Риск: И мог случайно перевести служебные команды (MID_REPLY, MID_NOTE). * Решение: Система увидела, что это код, и оставила как есть.
3. 📏 Динамическая верстка Так как русский текст длиннее, наш скрипт автоматически пересчитал макет. Где-то уменьшил шрифт на пару пунктов, где-то раздвинул ячейки таблицы. Визуально документ остался таким же, как оригинал.
Результат: ⏱️ Время: 35 минут 📄 Объем: 39 страниц PDF 💳 Цена: 568 руб. (Профессиональный тариф — из-за сложной верстки и работы с картинками).
Итог: Клиент получил готовый файл, который можно сразу отдавать в техподел.
🎉Нужно перевести сложный PDF и сохранить структуру? Пишите — поможем!