Команда исследователей DeepSeek разработала новую модель DeepSeek-OCR, которая кардинально меняет подход к распознаванию текста. В отличие от традиционных систем, работающих с текстовыми токенами, данная модель опирается на визуальные представления страниц. Это новшество вносит изменения в методы хранения и анализа информации.
В то время как обычные OCR-системы разбивают текст на символы и токены, что приводит к увеличению вычислительных затрат при увеличении объема документа, DeepSeek предлагает альтернативное решение. Текст преобразуется в изображение и кодируется с помощью уникального DeepEncoder в компактные визуальные токены, после чего текст восстанавливается. Это позволяет значительно снизить затраты при сохранении почти такой же точности.
В ходе экспериментов модель показала впечатляющие результаты: при десятикратном сжатии точность оставалась на уровне 97%, а при двадцатикратном — около 60%. Это свидетельствует о способности системы эффективно хранить длинные документы без потери смысла. Архитектура DeepSeek-OCR включает три ключевых этапа: локальное внимание для деталей, свёрточное сжатие в 16 раз и глобальное внимание для анализа структуры страницы. Также разработан механизм забывания, который позволяет постепенно снижать разрешение старого контекста, освобождая место для новой информации.
Не упустите возможность оптимизировать рутинные задачи с BotHub! Доступ к сервису не требует VPN, а для новых пользователей предусмотрено 100 000 бесплатных токенов для старта работы с нейросетями.