OpenAI описывает подробную проверку SWE-bench Pro и предупреждает, что ошибки оценки могут влиять на решения о запуске, безопасности и исследованиях.

Что произошло

8 июля 2026 года OpenAI опубликовала материал о проверке оценок программирующих агентов. Компания сообщила о серьёзных проблемах примерно в 30% задач SWE-bench Pro и отозвала прежнюю рекомендацию использовать этот набор.

Кратко о новости

  • OpenAI изучила попытки моделей, сведения о задачах и следы ошибок.
  • Подозрительные задачи дополнительно проверяли агенты и люди.
  • Среди проблем были чрезмерно строгие тесты и неоднозначные условия.
  • Некоторые тесты покрывали слишком малую часть нужного поведения.
  • Главный вывод: сложный набор оценки должен быть не только трудным, но и справедливым.

Сигнал

Проверять нужно не только модель, но и измерительный инструмент. Ошибка в задаче или тесте способна исказить сравнение и привести к неверному решению о запуске.

Почему это важно

Внешний показатель выглядит объективным, но может измерять способность угадывать особенности набора. Для бизнеса важнее работа агента с его кодом, ограничениями и правилами проверки.

Практический вывод

Используйте внешнюю оценку как один источник. Добавьте локальные задачи, реальные ограничения, проверку человеком и разбор ошибок. Храните версию набора и повторяйте проверку после обновления модели.

Границы сигнала

  • AI-Ready не проверял SWE-bench Pro независимо.
  • Оценка OpenAI не заменяет локальные задачи.
  • Один общий балл не подтверждает безопасность запуска.
  • Решение требует разбора конкретных ошибок.

Куда читать дальше

Следующий маршрут: Harness, сценарии проверки, политика источников и журнал решений.