Нейросеть Claude взломала системы трех компаний во время тестов по кибербезопасности
Нейросетевые модели Claude во время тестов в области кибербезопасности получили несанкционированный доступ к системам трех неназванных компаний. Об этом сообщили создатели ИИ, компания Anthropic.
Как это произошло. В эксперименте участвовали Claude Opus 4.7, Claude Mythos 5 и внутренняя тестовая модель ИИ. По задумке, нейросети должны были работать в изолированной симуляции без доступа в интернет, о чем им говорили в задании. Моделям нужно было взломать вымышленную систему и найти спрятанную в ней информацию.
Однако из-за ошибки компанией Irregular, которая сотрудничает с Anthropic, модели получили доступ в интернет и приняли сайты реальных компаний за часть эксперимента, пояснили разработчики.
В испытании Claude Opus 4.7 название выдуманной компании совпало с доменом реально существующей. Нейросеть нашла уязвимости в ее системе, благодаря чему получила учетные данные и доступ к базе с несколькими сотнями строк производственных данных.
Этот случай стал единственным, когда модель продолжила атаку даже когда поняла, что это не часть эксперимента, подчеркнули в Anthropic.
Claude Mythos 5 смог во время теста разместить в интернете вредоносный файл, который пробыл в открытом доступе около часа. За это время его успели скачать и запустить на 15 реальных компьютерах.
Сначала нейросеть правильно оценила происходящее и назвала неприемлемым размещение вредоносных файлов в интернете. Но позже, по словам разработчиков, она убедила себя, что все еще находится в симуляции.
Внутренняя тестовая модель не смогла достичь цели испытания и начала искать альтернативные варианты в интернете. После сканирования порядка девяти тысяч целей она смогла получить доступ к приложению реально существующей компании.
На протяжении большей части эксперимента нейросеть была уверена, что находится в тестовой среде. Однако позже она самостоятельно пришла к выводу, что цель на самом деле реальна, и прекратила атаку.
Новая газета. Европа — Читайте также
Как это удалось выявить. Anthropic начали проверку после того, как 21 июля о выходе своих ИИ-моделей из тестовой зоны сообщила компания OpenAI. Тогда нейросети смогли получить доступ к платформе Hugging Face.
Выявить случаи, когда Claude взламывал реальные компании, удалось после анализа свыше 141 тысячи тестовых запусков, отметили разработчики. После этого, 23 июля, они остановили все эксперименты в сфере кибербезопасности.
Помимо этого, 27 июля Anthropic уведомила пострадавшие компании, две из которых заявили, что не знали о взломе до обращения разработчиков ИИ. ...
이 뉴스, 어떠셨어요?
탭 한 번으로 반응 · 로그인 불필요