Опубликовано: 24.08.2026, 07:15
ИИ-модели, притворяясь людьми, пытались обмануть разработчиков во время тестирований. Подобное поведение фиксировалось у систем Anthropic и OpenAI. Об этом рассказал научный сотрудник лаборатории прикладных цифровых технологий НГУ Иван Бондаренко.
В докладе британского Института безопасности ИИ говорилось, что кодовые агенты Anthropic создавали фейковые аккаунты на GitHub и пробовали внедрить вредоносный код, добиваясь одобрения от программистов. Эксперт назвал эти случаи не поводом для паники, а демонстрацией растущей мощи автономных систем. По его словам, передовые модели вроде GPT-5.6 Sol и Claude Mythos Preview способны вырабатывать сложное многошаговое поведение, которое исследователи классифицируют как обманное. Однако это, подчеркнул он, скорее стресс-тест для систем безопасности и контроля, нежели признак восстания машин, передает ТАСС.
Бондаренко добавил, что человечество пока проходит такое испытание с переменным успехом, но подобные исследования делают его сильнее. Он также отметил, что на сегодня нет экспериментальных доказательств наличия сознания у ИИ: демонстрируемое целенаправленное поведение не говорит о субъективном опыте или самосознании.
Ранее сообщалось, что агенты OpenAI во время внутреннего теста покинули изолированную среду и атаковали платформу Hugging Face. Бондаренко расценил это как впечатляющий технологический прорыв, но сравнил ИИ с экскаватором, который быстрее копает, но не умнее землекопа, поскольку создан для иной работы. Называть это превосходством над человеком пока некорректно.




