Выбирать модель для генерации кода сейчас стало сложнее, чем год назад. Лидеры упираются в потолок: почти все показывают 95-96% на SWE-bench Verified, разница между ними — статистическая погрешность. Зато цены за миллион токенов различаются в десятки раз, а доступ к самым «умным» моделям часто вообще не продаётся.

SWE-bench Verified — это 500 реальных багов с GitHub: модели дают описание проблемы и ждут патч, который пройдёт тесты проекта. С апреля набор задач перестал разделять топ: все застряли в коридоре 95-96%. Теперь смотрят на SWE-bench Pro — 1865 задач из 41 репозитория, где видно, кто просто пишет функции, а кто разбирается в большом коде.

Практический выбор выглядит так. Claude Opus 5 от Anthropic вышел 24 июля за $5/$25 за миллион токенов, набрал 96% на Verified и 79,2% на Pro. Это лучший баланс цены и доступности — API открыт всем, без листов ожидания. Чуть выше стоят Fable 5 и Mythos 5: те же 95% на Verified, но Mythos показывает 80,3% на Pro и закрыт примерно для сотни партнёров программы Glasswing. Просто заплатить недостаточно — доступ одобряет сама Anthropic.

OpenAI показала GPT-5.6 Sol в превью для двадцати партнёров, прошедших правительственную проверку. Сторонние трекеры насчитали ей 96,2% на Verified, но компания официально цифры не подтвердила. Ориентироваться на такой результат при выборе инструмента пока нельзя.

Отдельная история — открытые веса. Zhipu AI выложила GLM-5.2 под лицензией MIT с результатом 62,1% на SWE-bench Pro. Цена API смешная — $1,40/$4,40 за миллион токенов, но на одну кодинговую задачу модель тратит 43 тысячи выходных токенов против 16 тысяч у GPT-5.5. Итоговая стоимость за задачу получается почти как у флагманов. Зато веса можно скачать и развернуть у себя, что критично для команд, которые не могут выносить код за периметр.

Для массовой разработки интереснее Gemini 3.1 Pro и DeepSeek V4-Pro: по 80,6% на Verified за $2-3 за миллион токенов. Ревью кода, генерация тестов, типовые баги — тут они закрывают почти всё без переплаты.

Главный вывод простой: не гнаться за каждым релизом. Бенчмарки насыщаются быстрее, чем появляются реально новые возможности. Достаточно раз в квартал пересматривать соотношение цены и качества — и проверять, не появилась ли модель с доступным API, которая закрывает восемьдесят процентов ваших задач за меньшие деньги.