OpenAI описывает подробную проверку SWE-bench Pro и предупреждает, что ошибки оценки могут влиять на решения о запуске, безопасности и исследованиях.
Что произошло
8 июля 2026 года OpenAI опубликовала материал о проверке оценок программирующих агентов. Компания сообщила о серьёзных проблемах примерно в 30% задач SWE-bench Pro и отозвала прежнюю рекомендацию использовать этот набор.
Кратко о новости
- OpenAI изучила попытки моделей, сведения о задачах и следы ошибок.
- Подозрительные задачи дополнительно проверяли агенты и люди.
- Среди проблем были чрезмерно строгие тесты и неоднозначные условия.
- Некоторые тесты покрывали слишком малую часть нужного поведения.
- Главный вывод: сложный набор оценки должен быть не только трудным, но и справедливым.
Сигнал
Проверять нужно не только модель, но и измерительный инструмент. Ошибка в задаче или тесте способна исказить сравнение и привести к неверному решению о запуске.
Почему это важно
Внешний показатель выглядит объективным, но может измерять способность угадывать особенности набора. Для бизнеса важнее работа агента с его кодом, ограничениями и правилами проверки.
Практический вывод
Используйте внешнюю оценку как один источник. Добавьте локальные задачи, реальные ограничения, проверку человеком и разбор ошибок. Храните версию набора и повторяйте проверку после обновления модели.
Границы сигнала
- AI-Ready не проверял SWE-bench Pro независимо.
- Оценка OpenAI не заменяет локальные задачи.
- Один общий балл не подтверждает безопасность запуска.
- Решение требует разбора конкретных ошибок.
Куда читать дальше
Следующий маршрут: Harness, сценарии проверки, политика источников и журнал решений.