OpenAI обучила отдельную модель искать атаки на другие модели, а затем использовала найденные атаки в обучении GPT-5.6. Компания сообщает об улучшении устойчивости; AI-Ready рассматривает это как сигнал о масштабировании проверок, а не как независимое подтверждение безопасности GPT-5.6.

Что произошло

15 июля 2026 года OpenAI рассказала о GPT-Red — модели для автоматического красного тестирования (red teaming). Она ищет уязвимости в других моделях и создаёт атаки с внедрением инструкций (prompt injection), чтобы разработчики могли исправить слабые места до широкого запуска.

OpenAI объясняет появление GPT-Red проблемой масштаба. Проверка моделей людьми помогает находить уязвимости, но не успевает расти вместе с их возможностями. Компания также пишет, что новейшие модели уже достигли предела распространённых оценок устойчивости. Иными словами, привычные тесты больше не показывают, насколько новые системы отличаются друг от друга.

GPT-Red нашла атаки, к которым предыдущие модели OpenAI оказались уязвимы. Компания использовала эти атаки для состязательного обучения GPT-5.6 и сообщает, что после этого модель стала заметно устойчивее к внедрению инструкций.

При этом OpenAI не предлагает заменить людей автоматикой. Компания намерена развивать GPT-Red вместе с проверками, которые проводят сотрудники и внешние специалисты, многоуровневой защитой и мониторингом в реальном времени.

Кратко о новости

  • OpenAI обучила GPT-Red автоматически искать уязвимости в других моделях.
  • Компания считает, что ручные проверки и привычные оценки устойчивости перестают справляться с ростом возможностей моделей.
  • Атаки GPT-Red показали слабые места предыдущих моделей OpenAI.
  • OpenAI использовала найденные атаки при обучении GPT-5.6 и сообщает о повышении устойчивости.
  • Автоматический подход дополняет людей, внешние проверки, защитные слои и мониторинг, а не заменяет их.

Сигнал

Проверка безопасности начинает масштабироваться вместе с возможностями моделей. Когда фиксированные тесты перестают различать новые системы, разработчики создают отдельные модели для поиска новых атак. Найденные сбои затем можно использовать как примеры в следующем цикле обучения.

Почему это важно

Для команд, которые внедряют модели и агентов, разовая проверка перед запуском быстро устаревает. Новая версия модели, новый инструмент или новый источник данных меняют поверхность атаки. Поэтому сценарии с вредными инструкциями нужно регулярно обновлять и повторять после изменений системы.

Практический вывод

Собирайте найденные способы обхода защиты в повторяемый набор проверок. После изменения модели, инструментов или инструкций запускайте его заново. Автоматические атаки сочетайте с проверкой человеком, ограничениями внешних действий и мониторингом реального поведения.

Границы сигнала

  • AI-Ready не воспроизводил внутренние испытания OpenAI.
  • Формулировка «стала заметно устойчивее» передаёт вывод OpenAI и не означает неуязвимость GPT-5.6.
  • Источник не доказывает, что один метод защищает от всех видов атак.
  • Результат одной компании нельзя автоматически переносить на другие модели и рабочие процессы.
  • Автоматическое красное тестирование дополняет людей и другие защитные слои, а не заменяет их.

Куда читать дальше

Дальше: Harness, сценарии проверки, точки утверждения, политика источников и журнал решений.