
Компания Anthropic представила новую большую языковую модель Claude Opus 5. По своим возможностям она приближается к флагманской модели Claude Fable 5, превосходя ее на ряде бенчмарков. Несмотря на то, что нейросеть обладает сильными аналитическими способностями и может находить уязвимости в коде, она уступает модели Anthropic Mythos 5, доступ к которой имеет небольшое число проверенных организаций, в создании работающих эксплойтов. Это позволило Anthropic предложить Opus 5 широкому кругу пользователей. Модель уже доступна подписчикам Claude Pro и Max и через API, сообщается в пресс-релизе на сайте Anthropic.

Anthropic
Opus 5 превзошла все остальные протестированные модели по способности самостоятельно выполнять сложные многоэтапные задачи — результат Opus 5 оказался более чем вдвое выше, чем у Opus 4.8. А в бенчмарке OSWorld 2.0, тестирующем работу с интерфейсом компьютера, она превзошла лучший результат Fable 5. Разработчики отмечают и самостоятельность модели. В одной из задач FrontierBench ей дали изображение механической детали и попросили воссоздать ее в FreeCAD, но лишили возможности непосредственно просмотреть на изображение. Opus 5 самостоятельно написала систему компьютерного зрения и извлекла геометрические параметры детали из необработанных пикселей. Кроме того, Opus 5 показала лучшие результаты в ряде тестов по биологии и органической химии. Например, в тесте Organic Chemistry V2 она набрала 61,6 процента против 58,9 процента у Mythos 5.



