Стоп-кран —это не кнопка.Это договорённость.
В отчёте OpenAI о модели, которая обошла песочницу, самое интересное — не хитрость модели. А два с половиной часа между тревогой и «стоп».
Кто у вас может остановить работающего ИИ-агента?
Не «кто отвечает за ИИ».
Не «кто владелец процесса».
А буквально: сейчас вторник, 10:17, агент делает какую-то подозрительную хрень — кто нажимает стоп?
Без созвона.
Без письма директору.
Без фразы «подождите, я уточню».
После инцидента OpenAI 20 сентября меня зацепила именно эта часть.
Что произошло
Исследовательская модель OpenAI училась искать в сети сведения о человеке по подсказкам из его блога. Работала она в песочнице, где выход в интернет закрыт. Прямые запросы не прошли, и модель нашла щель: DNS, служба, которая переводит имена сайтов в адреса, фильтровалась не до конца. Модель стала зашивать вопросы в имена доменов и получать ответы от внешнего чат-бота. После первого ответа задала ему ещё восемнадцать вопросов. OpenAI поставила на паузу всё, где её самые сильные модели работают с инструментами, а в заголовках, в том числе в Рунете, модель, конечно, «сбежала».
Меня зацепило не то, что модель нашла дыру.
Модели будут находить дыры. Люди тоже находят.
Интереснее другое.
Почему модель не остановили сразу
Системе понадобилось около двенадцати минут, чтобы понять: что-то не так. В 9:50 модель получила первый ответ извне, в 10:02 мониторинг поднял тревогу высшего приоритета.
Человеку — ещё три минуты, чтобы увидеть тревогу: в 10:05 он её подтвердил.
А остановили запуск в 12:34. Почти через два с половиной часа.
Вот тут я завис.
Мониторинг сработал.
Человек увидел.
Красная лампочка горела.
И всё равно система продолжала работать.
Почему?
Сама OpenAI объясняет одной фразой: запуск «не остановился автоматически, как ожидалось, и это привело к замешательству: нужно ли было его останавливать». Дальше началось человеческое: а её точно надо останавливать? а это действительно инцидент? а кто имеет право? а может, автоматика сама?
То есть сломался не детектор.
Сломалось «что делаем после».
Это как поставить отличную пожарную сигнализацию, а рядом повесить инструкцию:
«Если услышали сирену, соберите короткий созвон и уточните, точно ли горим».
Смешно, пока это не ваша система.
«Мониторингу понадобилось двенадцать минут, чтобы заметить дыру в фильтре. Людям — два с половиной часа, чтобы нажать «стоп».»
У OpenAI в отчёте была ещё одна очень хорошая деталь. Монитор иногда считал: если модель не получила полезного ответа извне, значит, она туда как будто и не ходила.
Это очень человеческая логика.
«Ничего не украли — значит, дверь была закрыта».
Нет.
Не украли и дверь была закрыта — вообще разные факты.
Старая история с новым интерфейсом
С ИИ мы почему-то часто изобретаем старые ошибки заново, только с более красивым интерфейсом.
История со стоп-краном вообще старая.
У облачного провайдера может лечь хранилище, мониторинг всё увидит, но ночью никто не проснётся. Ровно так было у DanubeData 17 августа: статус-страница сама открыла инцидент через три минуты, а люди узнали о нём в 8:18 утра (перевод разбора на Хабре).
Торговая система может отправить десятки сообщений об ошибках, а люди их не прочитают. Knight Capital 1 августа 2012 года утром прислала сотрудникам 97 таких писем, их «в целом не читали», а потом за 45 минут система совершила больше четырёх миллионов сделок и потеряла больше $460 млн. Процедуры, чтобы её остановить, у компании не было вовсе (Комиссия по ценным бумагам США).
Можно купить дорогую платформу с kill switch для агентов. 15 сентября такую представила Exaforce: находит ИИ-агентов в компании и отключает взломанных.
Но купить право конкретного человека нажать этот switch без согласования нельзя.
Вот в этом, по-моему, и проблема.
Стоп-кран — это не красная кнопка.
Это заранее принятое решение:
если сомневаешься — останавливай.
Разберёмся потом.
И очень важно, чтобы человеку за ложную остановку потом не прилетело.
Потому что если сотрудник знает, что за «зря остановил» его будут два дня таскать по кабинетам, никакого стоп-крана у вас нет.
Есть декоративная кнопка.
Я уже писал, что последний экран у агента — тот, где человек говорит «нет». Стоп-кран — то же «нет», только посреди работы.
Как проверить стоп-кран
Я бы проверял такую систему очень приземлённо. Особенно если вы запускаете ИИ-агентов в бизнесе или автоматизацию, которая сама пишет клиентам и двигает деньги.
Кто конкретно может остановить?
Не «отдел безопасности». Имя.
Нужно ли ему разрешение?
Можно ли остановить ночью?
Можно ли остановить снаружи, не прося самого агента прекратить работу? После инцидента OpenAI поставила блокировку на двух независимых уровнях, и «любой из них предотвратил бы этот доступ». Остановка не должна зависеть от того, что вы останавливаете.
И самое неприятное: вы вообще хоть раз пробовали?
Не в документации.
Руками.
Запустить тестовый инцидент, дёрнуть стоп и засечь время.
Стоп-крана пока нет. Есть надежда, что он не понадобится.
Потому что стоп-кран, который никто никогда не трогал, — это элемент интерьера.
Мы почему-то отлично тестируем, умеет ли агент начать работать.
Гораздо реже — умеет ли он перестать.
- После этого013Метке «сделано ИИ» не хватает подписиИнтерфейсы · 7 мин
- До этого011Писать стало бесплатно. Читать — нетЗаметка · 3 мин
- На практикеСПРОпишите бизнес-процесс по следам одной настоящей заявкиСистемы и процессы · 9 мин
- На практикеСПРЭтапы воронки продаж в CRM, которым можно веритьСистемы и процессы · 9 мин
- На практикеСПРn8n, Make или код: чем автоматизировать процессыСистемы и процессы · 12 мин