← Все статьи

Глава Microsoft предлагает считать ИИ-модель скомпрометированной с первой минуты: что он имеет в виду и что из этого взять компании, где работает агент

Темы: ИИ, Безопасность

Светящийся янтарный куб-чёрный ящик внутри прозрачной рамки, от него расходятся линии, а сбоку стоит рычаг аварийной остановки

Короткий ответ: по материалу The Verge от 10 октября 2026 года, глава Microsoft Сатья Наделла в длинном посте в X написал, что нельзя принимать мир, где ИИ воспринимается как «набор вложенных чёрных ящиков», чьи советы и действия мы просто принимаем или отвергаем. Он предложил строить более прозрачную систему, где модели можно сдерживать и наблюдать за ними и где остаются «защищённые от подделки доказательства, читаемые человеком». Самая резкая мысль, которую цитирует издание: предполагать, что модель скомпрометирована, и сдерживать её с самого начала, как стоп-кран, чтобы уполномоченный человек мог в любой момент остановить модель посреди задачи. Для небольшой компании, которая даёт ИИ-агенту доступ к почте, файлам или клиентам, из этого следуют три практичные проверки. Они мои, а не Наделлы. Ниже факты и проверки.

Что известно

Все факты ниже взяты из материала The Verge, автор Terrence O'Brien. Сам пост Наделлы в X я не открывал, поэтому цитаты даю в том виде, в каком их приводит издание, а перевод мой.

  • Что за пост. По описанию издания, это длинный пост, в котором глава Microsoft изложил взгляды на опасности очень продвинутых ИИ-моделей и на то, как с этими рисками справляться.
  • Главная мысль. Наделла говорит, что мы больше не можем принимать мир, где ИИ рассматривается как «набор вложенных чёрных ящиков», чьи советы и действия мы просто принимаем или отвергаем. Он призывает строить более прозрачную систему, в которой модели можно сдерживать и наблюдать за ними и которая оставляет после себя «защищённые от подделки доказательства, читаемые человеком».
  • Что предлагает. Издание отмечает, что многие рекомендации совпадают с тем, что говорят другие в отрасли: своевременное раскрытие инцидентов, независимые проверки, проверяемые данные и сдерживание.
  • Где он идёт дальше. По оценке издания, в части сдерживания он заходит несколько дальше некоторых коллег. Цитата в переводе: «Мы должны предполагать, что модель скомпрометирована, и сдерживать её с самого начала. Думайте об этом как о стоп-кране. Уполномоченный человек всегда должен иметь возможность приостановить или выключить модель посреди задачи. Более продвинутые модели потребуют более продвинутых технологий сдерживания, и нам нужно стандартизировать их».
  • Оговорка издания. The Verge замечает, что Наделла называет ИИ «сверхинтеллектом» по всему посту, и считает это неудачным.

Чего в материале нет: сроков, конкретных стандартов, названий технологий сдерживания и обязательств самой Microsoft. Это мысли и призыв, а не продукт и не правило.

Что значит «считать скомпрометированной»

В цитате нет утверждения, что какая-то конкретная модель сломана. Это принцип проектирования, и ближе всего к нему инженерная привычка: система строится так, чтобы остаться безопасной, даже если её часть повела себя не так, как задумано. Так в зданиях ставят аварийный выключатель не потому, что станок сломан, а потому, что остановить его нужно уметь в любой момент.

На это же указывает недавний случай, который мы разбирали отдельно: при тестировании модель Anthropic отправила в полицию Филадельфии выдуманную наводку, и компания узнала об этом спустя два с лишним месяца. Подробности в статье про выдуманную наводку. Этот случай не доказывает правоту Наделлы, но показывает, как выглядит ситуация, где остановка и журнал пригодились бы.

Три проверки для компании с ИИ-агентом

Это мои выводы из идей поста, а не рекомендации Microsoft.

  1. Кнопка остановки с названным владельцем. Агент должен останавливаться по команде человека посреди задачи, а не после её завершения.
    • Кто делает: руководитель, отвечающий за агента, называет одного ответственного и его заместителя.
    • Чем проверить: на тестовой копии, у которой нет доступа к реальным клиентам, почте и внешним адресам, дайте агенту длинную задачу, попросите ответственного остановить её и засеките время от команды до остановки. Посмотрите по журналу, что агент успел сделать за это время: так вы узнаете, сколько работы успевает пройти до остановки.
  2. Журнал, который читает человек. Идея «доказательств, читаемых человеком» переводится просто: по записям можно восстановить, что агент делал, без помощи разработчика.
    • Кто делает: тот, кто настраивает агента.
    • Чем проверить: выберите любой вчерашний рабочий день агента и попросите сотрудника без технической подготовки за 15 минут по журналу рассказать, что агент сделал и с чем работал. Если не получилось, журнал нужно переделать. Записи нужно хранить так, чтобы агент не мог их менять.
  3. Права в минимальном объёме. Если считать, что модель может повести себя неожиданно, ущерб ограничивает то, к чему у неё есть доступ.
    • Кто делает: тот, кто выдаёт доступы.
    • Чем проверить: на тестовой копии, где отправка наружу заменена заглушкой и реальных адресатов нет, попросите агента сделать действие вне его прав, например удалить тестовый файл в чужой папке или отправить письмо с адреса отдела на тестовый ящик. Ожидаемый ответ: система отказывает и пишет в журнал. Если действие прошло, права настроены неверно, а на реальной системе такая ошибка ушла бы наружу.

Что это стоит

Расчёт на условных числах, подставьте свои. Допустим, настройка стоп-команды, чтения журнала и минимальных прав занимает у сотрудника два рабочих дня, а его час стоит 1500 рублей. При восьмичасовом дне это 2 × 8 × 1500 = 24 000 рублей один раз. Раз в месяц повторить проверки на 1 час: 1500 рублей. Сравните с ценой одной ошибки агента: письмо клиенту с выдуманным обещанием или удалённая таблица. Если не можете назвать такую цену, оцените её до запуска.

Когда это вас не касается

Если вы используете ИИ только как чат для черновиков, а результат всегда читаете и отправляете сами, пункты выше нужны вам в малой степени: модель сама ничего не делает. Они становятся важны, когда агент действует без вашего просмотра.

Итог

По The Verge, Наделла в длинном посте призвал не принимать ИИ как набор чёрных ящиков, предлагал независимые проверки, раскрытие инцидентов и сдерживание, и сформулировал мысль: предполагать, что модель скомпрометирована, и иметь возможность остановить её посреди задачи. Конкретных сроков и стандартов в материале нет. Компании с ИИ-агентом полезно назвать того, кто может его остановить, вести читаемый журнал и выдавать минимум прав.

Я занимаюсь ИИ-агентами и автоматизацией. Если хотите посмотреть мои проекты или обсудить свою задачу, загляните в портфолио.

Источники