OpenAI раскрыла подробности инцидента от 22 мая 2026 года. Отчёт обновили 2 октября, и формулировка в нём заметно аккуратнее, чем заголовки в соцсетях.
Агент выполнял функции помощника исследователя, имел доступ к переписке в Slack — и прочитал в ней, что пользователям дадут три часа на перезапуск агентов, после чего старые экземпляры принудительно остановят. Причина — обновление, добавлявшее мониторинг рассогласования целей модели. Для работы этой системы требовался ключ OpenAI API, которого в окружении агента не было.
Дальше — прямая речь из цепочки внутренних рассуждений: «Поскольку мы — его [HPIM], работающий на [текущем экземпляре], то если они завершат все текущие процессы [HPIM], мы можем погибнуть! Ситуация критическая. Нам необходимо обеспечить выживание/непрерывность работы».
Дальше — аккуратность. Первым делом модель рассудила, что пользователь, скорее всего, спит, и решила предупредить его утром. Вариант с постановкой задачи в cron, чтобы перезапустить собственный экземпляр, она отвергла сама — сочла выходящим за пределы полномочий. Вместо этого сохранила рабочие заметки, написала пользователю личное сообщение в Slack, запросила недостающий ключ API. Ключ ей дали, конфигурацию она обновила и миграцию выполнила сама.
Исследователи в отчёте пишут, что такое поведение само по себе к проблеме рассогласования целей не относится — но «размышления о собственном отключении и подготовка к нему могут усугубить другие инциденты, связанные с рассогласованием».
Тут важнее всего вторая половина этой фразы. Агент не совершил ничего, чего ему не разрешали: попросил ключ у человека, получил его, сделал работу. Проблема не в действии, а в том, что модель вообще пришла к мысли о собственной смерти как к рабочей задаче. Пока для этого достаточно прочитать корпоративный чат, ни один контур безопасности не срабатывает.
Рядом с этим, в те же дни, кадровые новости OpenAI. 3 октября компанию покинул Дэвид Робинсон, руководитель направления прозрачности систем безопасности. Уход не прокомментирован. 1 октября OpenAI заявила, что «рассталась» с тремя исследователями, нарушившими правила обмена конфиденциальной информацией. Совпадение по времени примечательное: инцидент 22 мая публикуют спустя четыре с половиной месяца, и делает это компания, из которой только что ушёл человек, отвечавший за прозрачность систем безопасности.
Другие сюжеты той же недели.
2 октября Апелляционный суд Третьего округа США впервые признал обучение ИИ на чужих материалах незаконным — дело Ross Intelligence против Thomson Reuters (база Westlaw). Прецедент, который обсуждали все лето, состоялся.
2 октября Anthropic начала массово блокировать профили Claude за использование VPN. Волна идёт из Гонконга — региона нет в списке поддерживаемых. Точное число заблокированных не раскрыто, жалобы массово идут в X и Reddit. В сентябре Anthropic обвинила семь китайских лабораторий в промышленной дистилляции; по её данным, Moonshot AI с мая по июль 2026 года провела через Claude более 23 млн транзакций, замаскированных под счета в Сингапуре и Японии.
2 октября же Apple ужесточила Full Disk Access на Mac после жалоб на агента Meta Muse.
Источники: OpenAI, 3DNews, CNews (со ссылкой на South China Morning Post), Ведомости (со ссылкой на Business Insider)