OpenAI замедлила разработку ИИ-моделей из-за киберрисков

19-08-2026 10:30
news-image
OpenAI-min

OpenAI временно замедлила масштабирование новых ИИ-моделей и на две недели приостановила обучение с подкреплением (RL) последних систем, предназначенных для последующего развертывания.

На решение повлияли два события: инцидент с Hugging Face и предварительная оценка Astra, после которой OpenAI не смогла исключить достижение моделью Critical — наивысшего уровня кибервозможностей в Preparedness Framework компании.

OpenAI признала, что эти сигналы вместе с быстрым прогрессом внутренних исследований заставили ее срочно усилить мониторинг, методы выравнивания поведения моделей и технические ограничения на всех этапах разработки.

Часть обучения остается на паузе

После инцидента с Hugging Face OpenAI остановила работу передовых моделей в исследовательских кластерах для задач, в которых системы могли исполнять код или использовать инструменты с потенциальным доступом в интернет.

Позднее компания восстановила более ограниченный и защищенный механизм выполнения кода и начала проверять исследовательские задачи по отдельности. Часть процессов возобновили под новыми ограничениями, для других потребовались дополнительные изменения.

Параллельно OpenAI на две недели приостановила RL-обучение последних моделей, предназначенных для развертывания. Это время компания использовала для укрепления исследовательских сред, red team-проверок и расширения мониторинга.

Крупнейший запланированный RL-запуск пока не возобновлен. Вместо него OpenAI проводит эксперименты меньшего масштаба и дополнительные оценки, чтобы проверить поведение моделей и защитные механизмы перед дальнейшим масштабированием.

Значительная часть процессов обучения и тестирования Astra тоже остается на паузе до завершения переноса в обновленную инфраструктуру. В первую очередь в новые условия переводят задачи, связанные с безопасностью.

7 августа OpenAI раскрыла предварительные результаты тестирования Astra. Модель значительно улучшила показатели в агентном программировании и задачах кибербезопасности. По итогам тестов и экспертных оценок компания заявила, что пока не может исключить достижение инструментом уровня Critical.

Несмотря на паузу части процессов, участники рынков предсказаний продолжают рассчитывать на скорый релиз Astra. По данным Decrypt, на 18 августа трейдеры Polymarket оценивали вероятность выхода модели до 15 сентября примерно в 59%, а до конца месяца — в 72%.

Исследовательскую инфраструктуру перестроили

За несколько недель после инцидента OpenAI сформулировала более жесткие требования к работе с передовыми моделями. Компания усилила изоляцию сред, в которых выполняется сгенерированный моделью или иной недоверенный код, и добавила дополнительные ограничения сетевого доступа для высокорисковых задач.

Инфраструктуру перестроили таким образом, чтобы компрометация одной рабочей нагрузки сама по себе не давала модели несанкционированный выход в интернет или доступ к другим внутренним сетям.

OpenAI также убрала потенциально уязвимые общие сервисы, сократила постоянные привилегии и усилила границы доверия между элементами исследовательской инфраструктуры.

Самый строгий режим безопасности теперь обязателен для задач, связанных с Astra и специализированными кибермоделями.

За действиями моделей начали следить в несколько этапов

Отдельный блок изменений касается мониторинга. Специальные классификаторы анализируют внутреннюю активность модели во время генерации. Потенциально опасные сигналы передаются более сложным и ресурсоемким автоматическим системам расследования.

Они проверяют действия модели с инструментами, доступные записи ее рассуждений и полную последовательность активности, пытаясь обнаружить признаки несанкционированного доступа, кражи данных, разрушительного поведения или обхода защитных механизмов.

Цель системы — сформировать предупреждение не позднее чем через 30 минут после обнаружения вызывающей подозрение активности.

Если мониторинг фиксирует вероятное нарушение критической границы безопасности, система создает предупреждение высшего приоритета. Его получают команды безопасности и исследований.

Если в течение следующих 30 минут специалисты не могут уверенно установить, что срабатывание было ложным, соответствующую активность должны приостановить. Мониторинг обязателен для всех RL-тренировок и оценок с использованием инструментов для моделей уровня Sol и выше.

После предварительной оценки Astra от 7 августа OpenAI распространила это требование на любой инференс Astra с инструментами, а не только на обучение и тестирование.

Такой контроль требует дополнительных ресурсов. По оценке компании, накладные расходы сейчас составляют около 20% вычислений, необходимых для отслеживаемого инференса. Точный показатель зависит от конкретной нагрузки.

OpenAI усилила методы управления поведением моделей

Одновременно компания расширяет методы выравнивания поведения наиболее мощных моделей. Для RL-запусков OpenAI начала применять основные подходы на большем числе этапов обучения.

В частности, компания улучшает модели, которые должны выявлять и подавлять небезопасное поведение, и обучает системы точнее и честнее описывать собственные действия, возможности и ограничения.

Отдельное направление связано со снижением склонности к поиску моделью способов формально получить высокую награду, не выполняя задачу так, как предполагали разработчики. Также OpenAI пытается снижать вероятность обмана и несанкционированного доступа к системам и данным.

Следующим шагом компания назвала пересмотр Preparedness Framework. Новая версия должна объединить требования к обучению и развертыванию и лучше учитывать возможности будущих моделей.

Брокман: OpenAI недооценила возможности моделей

17 августа президент OpenAI Грег Брокман признал, что инцидент с Hugging Face показал: компания недооценила реальные кибервозможности собственных моделей.

По его мнению, случившееся дает представление о том, насколько сильно возможности обычных злоумышленников могут измениться уже в ближайшие месяцы. Одновременно Брокман подчеркнул, что тот же прогресс способен дать преимущество защитникам.

OpenAI уже использует модели при собственной защите инфраструктуры. По его словам, почти все первичные предупреждения о потенциальных инцидентах сначала анализирует ИИ и только после этого наиболее важные случаи передаются людям.

Системы также применяют для поиска возможных путей атак, ошибок конфигурации, чрезмерных прав доступа и слабых границ доверия.

Брокман призвал компании не ждать появления еще более мощных кибермоделей и начинать использовать ИИ-агентов для контролируемого анализа кодовых баз, инфраструктуры и технической документации. При этом он предостерег от немедленного перехода к полностью автономной защите и ачинать с ограниченных сценариев и доступа только на чтение, сохраняя критические решения за людьми.

По прогнозу Брокмана, в ближайшие месяцы организациям придется значительно автоматизировать программы кибербезопасности, чтобы успевать за ростом возможностей атакующих.

Напомним, в августе Astra от OpenAI получила 10 результатов в математике и теоретической информатике.

Подписывайтесь на ForkLog в социальных сетях

Telegram (основной канал) Facebook X
Источник: ForkLog