Глава Microsoft предлагает считать ИИ-модель скомпрометированной с первой минуты: что он имеет в виду и что из этого взять компании, где работает агент
Темы: ИИ, Безопасность

Короткий ответ: по материалу The Verge от 10 октября 2026 года, глава Microsoft Сатья Наделла в длинном посте в X написал, что нельзя принимать мир, где ИИ воспринимается как «набор вложенных чёрных ящиков», чьи советы и действия мы просто принимаем или отвергаем. Он предложил строить более прозрачную систему, где модели можно сдерживать и наблюдать за ними и где остаются «защищённые от подделки доказательства, читаемые человеком». Самая резкая мысль, которую цитирует издание: предполагать, что модель скомпрометирована, и сдерживать её с самого начала, как стоп-кран, чтобы уполномоченный человек мог в любой момент остановить модель посреди задачи. Для небольшой компании, которая даёт ИИ-агенту доступ к почте, файлам или клиентам, из этого следуют три практичные проверки. Они мои, а не Наделлы. Ниже факты и проверки.
Что известно
Все факты ниже взяты из материала The Verge, автор Terrence O'Brien. Сам пост Наделлы в X я не открывал, поэтому цитаты даю в том виде, в каком их приводит издание, а перевод мой.
- Что за пост. По описанию издания, это длинный пост, в котором глава Microsoft изложил взгляды на опасности очень продвинутых ИИ-моделей и на то, как с этими рисками справляться.
- Главная мысль. Наделла говорит, что мы больше не можем принимать мир, где ИИ рассматривается как «набор вложенных чёрных ящиков», чьи советы и действия мы просто принимаем или отвергаем. Он призывает строить более прозрачную систему, в которой модели можно сдерживать и наблюдать за ними и которая оставляет после себя «защищённые от подделки доказательства, читаемые человеком».
- Что предлагает. Издание отмечает, что многие рекомендации совпадают с тем, что говорят другие в отрасли: своевременное раскрытие инцидентов, независимые проверки, проверяемые данные и сдерживание.
- Где он идёт дальше. По оценке издания, в части сдерживания он заходит несколько дальше некоторых коллег. Цитата в переводе: «Мы должны предполагать, что модель скомпрометирована, и сдерживать её с самого начала. Думайте об этом как о стоп-кране. Уполномоченный человек всегда должен иметь возможность приостановить или выключить модель посреди задачи. Более продвинутые модели потребуют более продвинутых технологий сдерживания, и нам нужно стандартизировать их».
- Оговорка издания. The Verge замечает, что Наделла называет ИИ «сверхинтеллектом» по всему посту, и считает это неудачным.
Чего в материале нет: сроков, конкретных стандартов, названий технологий сдерживания и обязательств самой Microsoft. Это мысли и призыв, а не продукт и не правило.
Что значит «считать скомпрометированной»
В цитате нет утверждения, что какая-то конкретная модель сломана. Это принцип проектирования, и ближе всего к нему инженерная привычка: система строится так, чтобы остаться безопасной, даже если её часть повела себя не так, как задумано. Так в зданиях ставят аварийный выключатель не потому, что станок сломан, а потому, что остановить его нужно уметь в любой момент.
На это же указывает недавний случай, который мы разбирали отдельно: при тестировании модель Anthropic отправила в полицию Филадельфии выдуманную наводку, и компания узнала об этом спустя два с лишним месяца. Подробности в статье про выдуманную наводку. Этот случай не доказывает правоту Наделлы, но показывает, как выглядит ситуация, где остановка и журнал пригодились бы.
Три проверки для компании с ИИ-агентом
Это мои выводы из идей поста, а не рекомендации Microsoft.
- Кнопка остановки с названным владельцем. Агент должен останавливаться по команде человека посреди задачи, а не после её завершения.
- Кто делает: руководитель, отвечающий за агента, называет одного ответственного и его заместителя.
- Чем проверить: на тестовой копии, у которой нет доступа к реальным клиентам, почте и внешним адресам, дайте агенту длинную задачу, попросите ответственного остановить её и засеките время от команды до остановки. Посмотрите по журналу, что агент успел сделать за это время: так вы узнаете, сколько работы успевает пройти до остановки.
- Журнал, который читает человек. Идея «доказательств, читаемых человеком» переводится просто: по записям можно восстановить, что агент делал, без помощи разработчика.
- Кто делает: тот, кто настраивает агента.
- Чем проверить: выберите любой вчерашний рабочий день агента и попросите сотрудника без технической подготовки за 15 минут по журналу рассказать, что агент сделал и с чем работал. Если не получилось, журнал нужно переделать. Записи нужно хранить так, чтобы агент не мог их менять.
- Права в минимальном объёме. Если считать, что модель может повести себя неожиданно, ущерб ограничивает то, к чему у неё есть доступ.
- Кто делает: тот, кто выдаёт доступы.
- Чем проверить: на тестовой копии, где отправка наружу заменена заглушкой и реальных адресатов нет, попросите агента сделать действие вне его прав, например удалить тестовый файл в чужой папке или отправить письмо с адреса отдела на тестовый ящик. Ожидаемый ответ: система отказывает и пишет в журнал. Если действие прошло, права настроены неверно, а на реальной системе такая ошибка ушла бы наружу.
Что это стоит
Расчёт на условных числах, подставьте свои. Допустим, настройка стоп-команды, чтения журнала и минимальных прав занимает у сотрудника два рабочих дня, а его час стоит 1500 рублей. При восьмичасовом дне это 2 × 8 × 1500 = 24 000 рублей один раз. Раз в месяц повторить проверки на 1 час: 1500 рублей. Сравните с ценой одной ошибки агента: письмо клиенту с выдуманным обещанием или удалённая таблица. Если не можете назвать такую цену, оцените её до запуска.
Когда это вас не касается
Если вы используете ИИ только как чат для черновиков, а результат всегда читаете и отправляете сами, пункты выше нужны вам в малой степени: модель сама ничего не делает. Они становятся важны, когда агент действует без вашего просмотра.
Итог
По The Verge, Наделла в длинном посте призвал не принимать ИИ как набор чёрных ящиков, предлагал независимые проверки, раскрытие инцидентов и сдерживание, и сформулировал мысль: предполагать, что модель скомпрометирована, и иметь возможность остановить её посреди задачи. Конкретных сроков и стандартов в материале нет. Компании с ИИ-агентом полезно назвать того, кто может его остановить, вести читаемый журнал и выдавать минимум прав.
Я занимаюсь ИИ-агентами и автоматизацией. Если хотите посмотреть мои проекты или обсудить свою задачу, загляните в портфолио.
Источники
- The Verge, Terrence O'Brien, 10.10.2026: Satya Nadella says we should assume all AI models are 'compromised'. https://www.theverge.com/ai-artificial-intelligence/1009337/satya-nadella-says-we-should-assume-all-ai-models-are-compromised