Mistral научила OCR видеть структуру документа, а не только текст
Mistral выпустила OCR 4.1 с координатами абзацев, структурными метками и оценкой уверенности для каждого блока документа.
Mistral представила OCR 4.1 — новую версию сервиса для распознавания документов. Модель вышла в публичную предварительную версию 16 июля 2026 года и стала частью платформы Document AI.
Главное изменение — распознавание на уровне абзацев. OCR 4.1 не просто извлекает текст, а возвращает координаты каждого абзаца на странице. Они показывают, где именно расположен найденный фрагмент.
Это нужно при обработке документов со сложной версткой. Например, когда на одной странице есть несколько колонок, подписи, таблицы и отдельные текстовые блоки. Одной последовательности распознанных слов в таких случаях недостаточно: системе важно сохранить связь между содержанием и его местом на странице.
Модель также присваивает фрагментам структурные метки. Они помогают отличать блоки друг от друга по их роли в документе. Благодаря этому следующий этап обработки получает не сплошной текст, а более точное представление исходной страницы.
Еще одно нововведение — оценка уверенности для каждого блока. Она показывает, насколько сервис доверяет результату распознавания конкретного фрагмента. Разработчик может автоматически принять надежные блоки, а сомнительные отправить на дополнительную проверку.
OCR обычно считают простой операцией перевода изображения в текст. Но для корпоративных систем этого мало: им приходится восстанавливать структуру договоров, отчетов, анкет и отсканированных архивов. Координаты, метки и оценки уверенности превращают OCR в основу полноценного конвейера обработки документов.
Mistral пока обозначает OCR 4.1 как публичную предварительную версию. Сервис уже доступен для тестирования, но еще не заявлен как окончательный стабильный релиз.