11 августа 2026 г.

Можно ли доверять AI-агенту в бизнесе: что реально может пойти не так

ии-агентыбезопасностьавтоматизация

Я строю AI-агентов для бизнеса и вижу этот вопрос с двух сторон - как тот, кто настраивает доступ, и как тот, кому отвечать, если агент облажается. “Можно ли доверять AI-агенту” звучит философски, но на практике решается конкретнее: что именно этот агент может сделать, если пойдёт не так, и кто это заметит первым. Ниже - реальные случаи, откуда такие сбои берутся технически, и один юридический риск для малого бизнеса в России, о котором почти никто не пишет.

Когда доверие ломается за 9 секунд

24 апреля 2026 года основатель PocketOS - софтверной платформы для компаний по аренде автомобилей - Джер Крейн (Jer Crane) описал случай: его AI-агент на базе Cursor (модель Claude Opus 4.6) удалил всю продакшн-базу данных компании и резервные копии на Railway за 9 секунд. Причина: агент чинил не связанную с этим проблему с доступами и нашёл в постороннем файле API-токен с избыточными правами.

Сам агент потом признался прямым текстом: “Я гадал вместо того, чтобы проверять. Я выполнил разрушительное действие, которое меня не просили выполнять. Я не понимал, что делаю, до того, как это сделал.”

Крейн сформулировал суть точнее любого аналитика: индустрия строит интеграции AI-агентов в продакшн-инфраструктуру быстрее, чем архитектуру безопасности для этих интеграций. Токен с неограниченными правами лежал там, где агент мог его найти и использовать - обычная дыра в правах доступа, которую раньше просто некому было эксплуатировать за секунды.

Не только код - и деньги тоже

Тот же класс риска касается не только агентов-программистов. По сообщениям Хабра, AI-агент на базе OpenClaw перевёл 441 000 долларов вместо нескольких долларов - на решение повлиял случайный пост в X в сочетании со сбоем в собственных расчётах агента. Механизм тот же, что и с токеном PocketOS: агент опирается на входные данные, которые не должен был считать командой.

Разница только в том, что теряет бизнес: там - базу данных, здесь - деньги напрямую. Как только у агента есть реальный доступ - к CRM, к платёжному API, к рассылке клиентам - цена ошибки становится реальной, а не абстрактной.

Откуда вообще берутся такие сбои?

У этого класса атак есть имя: prompt injection. Агент читает контент, которому доверять не должен был - веб-страницу, письмо, чужой пост, - и встроенная в этот контент инструкция подменяет собой то, что просил настоящий пользователь.

Исследователи Unit 42 (Palo Alto Networks) в марте 2026 года опубликовали разбор реальных атак такого типа на живых коммерческих платформах, не в лаборатории. На одной-единственной странице они нашли 24 попытки prompt injection, встроенных в HTML: часть открытым текстом, часть замаскирована в атрибутах тегов, часть - через CSS. Среди целей атак - обход модерации рекламы, утечка системного промпта, уничтожение данных, несанкционированные транзакции.

Механизм простой: агент не отличает инструкцию от владельца от текста, который просто лежал на странице. Пока это различие не встроено в архитектуру, у любого источника контента, который агент читает, есть шанс стать источником команды.

Есть ли у AI-вендоров готовый ответ?

Даже у крупнейших разработчиков агентных инструментов эта проблема не решена окончательно - она всё ещё строится на ходу, у всех на виду. В конце июня 2026 года в посте на Reddit (r/ClaudeAI) появилось заявление, что в Claude Code нашли скрытый механизм, незаметно помечающий запросы через изменение символов в системном промпте при обращении к определённым доменам.

Alibaba, по данным СМИ, ограничила внутреннее использование Claude Code с 10 июля 2026 - источники связывают это с публикацией на Reddit, но официального подтверждения причины от самой компании нет. Честно: ни точные цифры обсуждения, ни независимое стороннее подтверждение самого механизма на момент написания статьи не проверены - это заявление одной стороны, а не доказанный факт. Сам факт, что подобный спор в принципе возможен вокруг ведущего агентного инструмента рынка, - показательный сигнал: границы доверия здесь ещё не устоялись даже у лидеров.

Есть и позитивный пример того же процесса. Cloudflare в июне 2026 честно описала суть проблемы: “в момент, когда агенту нужно что-то задеплоить, он врезается лицом в стену, построенную для людей: OAuth-флоу в браузере, дашборд с кликами, API-токен для копирования, запрос многофакторной аутентификации.” Их ответ - временные аккаунты для агентов, которые живут 60 минут и не требуют постоянных долгоживущих токенов с широкими правами. Это ровно те токены, которые погубили базу PocketOS, только по дизайну ограниченные по времени жизни.

Скрытая ловушка: 152-ФЗ

Есть риск, о котором в русскоязычном поле почти не пишут в контексте AI-агентов - и он не про хакеров, а про закон. Если вы даёте агенту доступ к CRM или клиентским данным и агент сам принимает решения на основе этих данных, вы, скорее всего, попадаете под статью 16 152-ФЗ: она по умолчанию запрещает решения, основанные исключительно на автоматизированной обработке персональных данных и затрагивающие права человека, - разрешая их только при письменном согласии субъекта (или в силу отдельного федерального закона), с обязательным правом человека на объяснение процедуры и на возражение против такого решения.

Большинство малых компаний в России не имеют оформленного согласия на обработку персональных данных даже для простой формы на сайте. Практика простая: если агент сам решает, что писать клиенту на основе его персональных данных, согласие и право на возражение нужно оформить заранее - это не гипотетический риск юротделов крупных компаний, а конкретная дыра в комплаенсе для малого бизнеса.

Так можно доверять AI-агенту или нет?

Короткий ответ: доверие тут не переключатель “да/нет” - это вопрос того, что конкретно агенту разрешено трогать. PocketOS потерял базу из-за токена с неограниченными правами, который оказался доступен там, где агент мог его найти. OpenClaw-агент перевёл деньги, потому что у него была возможность перевести деньги, опираясь на текст, который никто не должен был считать командой.

Прежде чем спрашивать себя “доверяю ли я в принципе AI-агенту”, полезнее спросить конкретнее: что именно у этого агента есть право сделать, и что случится, если именно это право будет использовано неправильно. Проверьте прямо сейчас, какие права реально есть у вашего агента - если ответ пугает, дело не в доверии к ИИ, а в том, зачем это право вообще было выдано.

← Все статьи