OpenAI обучила отдельную модель искать атаки на другие модели, а затем использовала найденные атаки в обучении GPT-5.6. Компания сообщает об улучшении устойчивости; AI-Ready рассматривает это как сигнал о масштабировании проверок, а не как независимое подтверждение безопасности GPT-5.6.
Что произошло
15 июля 2026 года OpenAI рассказала о GPT-Red — модели для автоматического красного тестирования (red teaming). Она ищет уязвимости в других моделях и создаёт атаки с внедрением инструкций (prompt injection), чтобы разработчики могли исправить слабые места до широкого запуска.
OpenAI объясняет появление GPT-Red проблемой масштаба. Проверка моделей людьми помогает находить уязвимости, но не успевает расти вместе с их возможностями. Компания также пишет, что новейшие модели уже достигли предела распространённых оценок устойчивости. Иными словами, привычные тесты больше не показывают, насколько новые системы отличаются друг от друга.
GPT-Red нашла атаки, к которым предыдущие модели OpenAI оказались уязвимы. Компания использовала эти атаки для состязательного обучения GPT-5.6 и сообщает, что после этого модель стала заметно устойчивее к внедрению инструкций.
При этом OpenAI не предлагает заменить людей автоматикой. Компания намерена развивать GPT-Red вместе с проверками, которые проводят сотрудники и внешние специалисты, многоуровневой защитой и мониторингом в реальном времени.
Кратко о новости
- OpenAI обучила GPT-Red автоматически искать уязвимости в других моделях.
- Компания считает, что ручные проверки и привычные оценки устойчивости перестают справляться с ростом возможностей моделей.
- Атаки GPT-Red показали слабые места предыдущих моделей OpenAI.
- OpenAI использовала найденные атаки при обучении GPT-5.6 и сообщает о повышении устойчивости.
- Автоматический подход дополняет людей, внешние проверки, защитные слои и мониторинг, а не заменяет их.
Сигнал
Проверка безопасности начинает масштабироваться вместе с возможностями моделей. Когда фиксированные тесты перестают различать новые системы, разработчики создают отдельные модели для поиска новых атак. Найденные сбои затем можно использовать как примеры в следующем цикле обучения.
Почему это важно
Для команд, которые внедряют модели и агентов, разовая проверка перед запуском быстро устаревает. Новая версия модели, новый инструмент или новый источник данных меняют поверхность атаки. Поэтому сценарии с вредными инструкциями нужно регулярно обновлять и повторять после изменений системы.
Практический вывод
Собирайте найденные способы обхода защиты в повторяемый набор проверок. После изменения модели, инструментов или инструкций запускайте его заново. Автоматические атаки сочетайте с проверкой человеком, ограничениями внешних действий и мониторингом реального поведения.
Границы сигнала
- AI-Ready не воспроизводил внутренние испытания OpenAI.
- Формулировка «стала заметно устойчивее» передаёт вывод OpenAI и не означает неуязвимость GPT-5.6.
- Источник не доказывает, что один метод защищает от всех видов атак.
- Результат одной компании нельзя автоматически переносить на другие модели и рабочие процессы.
- Автоматическое красное тестирование дополняет людей и другие защитные слои, а не заменяет их.
Куда читать дальше
Дальше: Harness, сценарии проверки, точки утверждения, политика источников и журнал решений.