В научных статьях числовые данные играют ключевую роль для сравнения технологий, уточнения моделей и выявления новых тенденций. Однако эти значения обычно спрятаны в тексте вместе с дополнительной информацией — единицами измерения, временем, местом и методами исследований, что затрудняет их ручной сбор, особенно при большом объеме публикаций.
Для решения этой задачи команда из Forschungszentrum Jülich создала фреймворк Quinex (Quantitative Information Extraction), который автоматически извлекает количественные данные из научных текстов, определяет их контекст и структурирует их в удобный формат. Система не просто находит цифры, но и связывает их с параметрами, методами и источниками, позволяя получить полное представление о данных, например, эффективность в процентах с указанием года и метода измерения.
Quinex построен на открытых языковых моделях, что обеспечивает прозрачность, удобство доработки и возможность работы без мощной инфраструктуры, что особенно важно для научных групп с ограниченными ресурсами.
По результатам тестирования система достигла около 98% точности в распознавании чисел и единиц измерения и высоких показателей в классификации параметров. Quinex успешно обрабатывает данные из разных областей — энергетики, медицины, материаловедения и других, показывая универсальность инструмента.
Разработчики подчеркивают, что Quinex не заменяет исследователя, а служит вспомогательным инструментом, позволяющим быстро собрать числовую информацию, оставляя за учёным ответственность за интерпретацию. Каждое число можно связать с исходным фрагментом статьи, что обеспечивает прозрачность работы системы.
В дальнейшем команда планирует расширить функционал Quinex, добавив отраслевые наборы данных и модели для лучшей адаптации к специфике различных дисциплин. Проект будет доступен в открытом доступе, что позволит научному сообществу развивать и адаптировать инструмент под собственные нужды.