Компания Anthropic анонсировала выход обновленной модели Claude Sonnet 4.6, которая на ряде тестов уверенно приближается к флагманской версии Opus 4.6 и даже превосходит её в некоторых аспектах. Стоимость модели остается на уровне $3/$15 за миллион токенов, что делает её на 1,7 раза более доступной по сравнению с Opus.

На тестах SWE-bench Verified Sonnet 4.6 достиг 79,6% результата, в то время как Opus 4.6 — 80,8%. В управлении компьютером модель показала 72,5% против 72,7% у Opus. Однако на задачах в офисной среде Sonnet 4.6 обошла Opus с оценкой 1633 против 1606 баллов Elo. Примечательно, что на бенчмарке ARC-AGI-2, посвященном нестандартным задачам, модель продемонстрировала рост с 13,6% до 58,3%.

Sonnet 4.6 теперь является стандартной моделью на платформе claude.ai и Claude Cowork для всех пользователей. В бета-доступе имеется контекстное окно в 1 миллион токенов. Anthropic также отмечает прогресс в функции управления компьютером, которую они первыми внедрили в 2024 году. За 16 месяцев Sonnet улучшила свои показатели на OSWorld с 0 до 72,5%, достигая уровня, сопоставимого с человеческим.

Таким образом, релиз Sonnet 4.6 продолжает тенденцию, когда «средние» модели начинают игнорировать предшественников. У конкурентов наблюдается аналогичная ситуация: несмотря на то, что GPT-5.2 Pro превосходит Sonnet 4.6 по логическому мышлению, на ARC-AGI-2 и офисных задачах Sonnet 4.6 демонстрирует лучшие результаты. В свою очередь, Gemini 3 Pro уступает Sonnet 4.6 по большинству метрик.