
На Terminal‑Bench 4.0 модель набрала 66,4% против 52,3% у Opus 5, 55,8% у Fable 5.1 и 57,9% у GPT-6 Astra. На FrontierCode 1.1 результат составил 54,4% против 53,3% у Astra, а на CursorBench 4.0 — 57,8% против 51,8% у Fable 5.1 и 46,6% у Opus 5.
Компания делает отдельный акцент на длинных задачах по разработке. Один из ранних пользователей проверил и исправил кодовую базу на 200 тысяч строк меньше чем за три часа; Opus 5 выполняла ту же работу больше 20 часов и использовала в 2,5 раза больше токенов. Другой тестировщик завершил миграцию проекта на 680 тысяч строк меньше чем за день. Это примеры раннего доступа, а не независимые воспроизводимые тесты.

Цена API снизилась с 5/25 до $4 за миллион входных и $20 за миллион выходных токенов, а чтение из кэша подешевело с $0,50 до $0,20.
Контекстное окно составляет 1 млн токенов, максимальный ответ — 128 тысяч. Модель уже доступна под ID claude-opus-5-5 в Claude API, AWS, Google Cloud и Microsoft Azure.
При миграции нужно учитывать несколько несовместимых изменений: thinking теперь нельзя отключить, а принудительный выбор инструмента через tool_choice возвращает ошибку.
Если новость понравилась, приглашаю в канал AI for Devs. Каждый день публикую похожие материалы: новые модели, агенты, практические кейсы и новости из мира AI.
