Компания Alibaba представила две новейшие мультимодальные модели: Qwen3-VL-2B и Qwen3-VL-32B. Последняя модель уже привлекла внимание исследователей благодаря своим результатам, которые сопоставимы и даже превосходят характеристики таких систем, как GPT-5 mini и Claude 4 Sonnet, особенно в областях STEM, визуальных вопросах, распознавании текста и анализе видео. Несмотря на то, что Qwen3-VL-32B имеет всего 32 миллиарда параметров, она уверенно соперничает с более крупными системами, достигающими 235 миллиардов параметров, и занимает лидирующие позиции на ряде бенчмарков, таких как OSWorld. Это стало возможным благодаря уникальной архитектуре с иерархическим вниманием, которая эффективно интегрирует текст, изображения и видео. Модель способна последовательно анализировать видеокадры, понимая сюжет и причинно-следственные связи, что делает её особенно ценной для видеоаналитики и образовательных задач. Обе модели доступны для тестирования на Hugging Face и Qwen Studio, где можно интегрировать их в свои проекты. Также вы можете воспользоваться BotHub для автоматизации рутинных задач, получив 100 000 бесплатных токенов для старта.