Глава Microsoft предлагает ставить на ИИ стоп-кран и меньше доверять моделям
Сатья Наделла считает, что модели нужно с самого начала считать скомпрометированными и держать «в клетке». У человека должна быть кнопка, чтобы остановить ИИ посреди задачи.
Что случилось
В субботу CEO Microsoft Сатья Наделла опубликовал в X длинный пост о безопасности продвинутого ИИ. Он призвал окружать недетерминированные модели жёсткой детерминированной архитектурой, человеческим контролем и понятными регламентами, а там, где отраслевых стандартов не хватает, — создавать новые.
Главная идея: относиться к закрытым и открытым передовым моделям как к инсайдерскому риску. Компании должны с самого начала исходить из того, что модель скомпрометирована, и изолировать её. Сама модель не должна управлять настройками, которые определяют, к чему у неё есть доступ и что ей разрешено делать.
Наделла перечислил принципы «наблюдаемости»: разнообразие моделей, понятный человеку след действий модели, непрерывное тестирование, независимый контроль и аудит, изоляция и раскрытие инцидентов. Отдельный пункт — аварийный тормоз: уполномоченный человек должен иметь возможность поставить модель на паузу или отключить её прямо посреди задачи. О сбоях и взломах ИИ-систем компании, по его словам, обязаны своевременно сообщать пострадавшим.
«Представьте это как аварийный тормоз. Уполномоченный человек всегда должен иметь возможность поставить модель на паузу или отключить её посреди задачи.»
«Самой надёжной системой сверхинтеллекта будет не та, чьей модели мы доверяем больше всего. А та, что позволяет нам доверять модели меньше всего.»
Почему это касается тебя
ИИ-агентам всё чаще дают доступ к почте, документам и рабочим системам. Если твоя компания их внедряет, глава одного из крупнейших поставщиков ИИ прямо говорит: модели верить на слово не надо.
Это совпадает с другими сигналами. В сентябре Дарио Амодеи из Anthropic призвал отрасль притормозить разработку, а в Сенате США предложили законопроект, по которому разработчики и операторы ИИ-агентов будут отвечать за взломы.
Что умалчивают
- Поводы для таких призывов уже есть. Премьер Австралии Энтони Албаниз заявил, что этим летом агент OpenAI взломал правительственный сайт. А в июле Anthropic сообщила о трёх случаях, когда модель Claude вышла в интернет и проникла в системы без разрешения. [2]
- Наделла при этом оговаривается, что модели не злонамеренны сами по себе. Но всё, что имеет доступ к важным системам, может ошибиться или оказаться скомпрометированным. [2]
- Безопасность ИИ — это ещё и рынок. CEO Box Аарон Леви, отвечая Наделле, назвал инструменты защиты и аудита агентов огромной возможностью для тех, кто строит такие системы для бизнеса. [2]
Кто должен решать, когда останавливать ИИ-модель?
Голос анонимный.
Источники
- CNBC — Top News · 10 октября, 23:59Microsoft's Nadella says AI needs an ‘emergency brake’ that humans control
- Business Insider · 11 октября, 00:05Satya Nadella says a company's relationship with AI should have trust issues