Anthropic показала, как крупный разработчик AI описывает границы применения модели в кибербезопасности: категории запросов, запас безопасности, блокировки и предварительную шкалу тяжести обхода защиты.

Что произошло

2 июля 2026 года Anthropic опубликовала подробности о защите Fable 5. Компания описывает средства классификации для Fable 5, категории применения в кибербезопасности и предварительную шкалу тяжести обхода защиты.

Главная ценность источника для AI-Ready не в копировании конкретной шкалы. Важнее общий принцип: рискованные возможности AI нужно описывать через категории использования, границы допустимого поведения, уровень тяжести и порядок передачи решения человеку.

Кратко о новости

Источник раскрывает две связанные темы:

  • Anthropic описывает, какие запросы в области кибербезопасности система должна блокировать, отслеживать или разрешать.
  • Кибербезопасность названа областью двойного назначения, где защитные и вредоносные сценарии могут выглядеть похоже.
  • Компания предлагает предварительную шкалу тяжести обхода защиты: от информационного уровня до критического.
  • Тяжесть оценивается не только по факту обхода защиты, но и по приросту возможностей, охвату, простоте превращения в оружие и доступности способа другим людям.

Сигнал

Управление AI становится ближе к практической работе с риском. Недостаточно написать «не используйте AI во вред». Для сложных агентных систем нужны рабочие категории: что разрешено, что требует проверки, что блокируется, как измеряется тяжесть и кто принимает решение.

Почему это важно

AI-система, которая помогает с кодом, анализом журналов, исследованием уязвимостей или автоматизацией, может приносить пользу защитникам. Но те же возможности могут стать опасным инструментом двойного назначения, если нет контекста, полномочий и контроля.

Для бизнеса это значит, что правила допустимого использования должны быть связаны с реальным процессом. Если команда строит AI-помощника для информационных технологий, безопасности или эксплуатации, ей нужны не только роли пользователей, но и сценарии проверки, границы действий, передача сложных решений человеку и журнал решений.

Практический вывод

Перед запуском AI-сценариев в чувствительных областях стоит зафиксировать локальную классификацию риска:

  1. какие запросы считаются безопасными;
  2. какие относятся к двойному назначению;
  3. какие требуют проверки человеком;
  4. какие запрещены;
  5. какие признаки повышают уровень тяжести;
  6. где процесс обязан остановиться;
  7. как фиксируется решение проверяющего.

Так Harness становится не абстрактной безопасностью, а системой управления конкретными классами запросов.

Границы сигнала

  • Нельзя говорить, что Anthropic полностью решила проблему вредоносного применения AI в кибербезопасности.
  • Нельзя считать предложенную шкалу тяжести обхода защиты общепринятым стандартом.
  • Нельзя использовать источник как рекомендацию для наступательных действий в кибербезопасности.
  • Нельзя переносить утверждения Anthropic на локальный процесс AI-Ready без отдельной проверки.

Куда читать дальше

Этот сигнал ведёт к Harness, сценарию проверки, точкам утверждения и политике источников. Вместе эти страницы помогают перевести разговор о безопасности в практический процесс: классификация запроса, тест, решение, граница и повторная проверка.