Разработанная модель MedASR обладает 105 миллионами параметров и обучена на 5000 часах обезличенной медицинской речи. Ошибки в медицинских диктовках могут привести к искажению смысла, и именно поэтому MedASR фокусируется на точной расшифровке клинических разговоров, а не на общих данных. Архитектура модели основана на Conformer, и она обрабатывает моноаудио формата int16 с частотой 16 кГц, выдавая текст без дополнительных интерпретаций. Разработчики рассматривают MedASR как основу для голосовых приложений в сфере здравоохранения, включая расшифровку радиологических заключений и бесед между врачами и пациентами. Модель также можно дообучать под специфические задачи, например, для распознавания акцентов или шумов. В будущем планируется интеграция с генеративными моделями, такими как MedGemma, для создания более сложных резюме и ответов на вопросы по тексту.