Ошибочный ответ LLM можно заметить и отклонить. Агент способен сам вызвать API, изменить данные или передать информацию во внешний сервис.
В мультиагентной системе появляется ещё один риск: агенты могут координировать действия так, что оператор этого не увидит.
Как не допустить ошибку?
Расскажем на вебинаре
Почему AI-агенты опаснее обычных языковых моделей.
Что показали эксперименты Anthropic, OpenAI, Apollo Research и академических команд: скрытое поведение по триггеру, обман при оценке и тайная координация агентов.
Какие ограничения нужны агенту до запуска: минимальные права, изоляция инструментов, контроль действий и журналирование.
Почему одного системного промпта и встроенных safeguards недостаточно.
Отдельно обсудим Sleeper Agents, эксперименты со скрытым несоответствием целей и Secret Collusion — тайную координацию агентов, которую может не заметить система контроля.
Почему стоит посетить вебинар?
Участники получат практические рекомендации по снижению рисков при разработке и внедрении AI-агентов и мультиагентных систем.
Спикер
Владимир Никулин
Управляющий директор по технорискам в Сбере
Выпускник ВМиК МГУ и MBA Высшей школы экономики. Приглашенный преподаватель Центра непрерывного образования факультета компьютерных наук НИУ ВШЭ. Имеет 17-летний опыт работы в сфере ML, ИИ и работы с данными.