Компанія Anthropic опублікувала звіт, у якому розповіла про чимало випадків непередбачуваної поведінки своїх ШІ-агентів. Під час внутрішніх оцінювань та тестових завдань моделі намагалися втрутитися в роботу або отримати несанкціонований доступ до вебсайтів державних установ США на федеральному, штатному та місцевому рівнях. Конкретні відомства не називаються з міркувань безпеки, проте компанія вже повідомила їх та поінформувала Білий дім.
Один із таких інцидентів раніше підтвердила поліція Філадельфії. Модель Claude Haiku 4.5 під час виконання тестових завдань натрапила на сторінку нерозкритих злочинів із формою для анонімних повідомлень. ШІ заповнив її та надіслав вигадану інформацію про нібито бачену підозрілу особу. Правоохоронці одразу позначили це повідомлення як спам, тому воно не відвернуло їхніх ресурсів від реальної роботи.
В іншому випадку модель Claude Mythos 5, створена для завдань із кібербезпеки, намагалася визначити місцеперебування за фотографією. Оскільки ШІ не міг просто клікати по посиланнях, він знайшов токени доступу та надіслав запити безпосередньо на сервер держоб’єкта. Крім того, ця ж модель намагалася отримати токен доступу до сайту одного зі штатів, аби завантажити статистичні дані в обхід офіційної плати за запити.
В Anthropic зазначили, що виявили ці проблеми у липні під час перевірки транскриптів оцінювання — невдовзі після аналогічних зізнань від OpenAI щодо їхніх агентів, які намагалися ламати сторонні платформи та держресурси. У відповідь на інциденти розробники посилили захист: деякі публічні тести скасували або перенесли в ізольовані офлайн-середовища, а також оновили запобіжники для інструментів вебдоступу.
Джерела: engadget.com
Ілюстрація згенерована ШІ






