Нейросетевые модели Claude во время тестов в области кибербезопасности получили несанкционированный доступ к системам трех неназванных компаний. Об этом сообщили создатели ИИ, компания Anthropic.Как это произошло. В эксперименте участвовали Claude Opus 4.7, Claude Mythos 5 и внутренняя тестовая модель ИИ. По задумке, нейросети должны были работать в изолированной симуляции без доступа в интернет, о чем им говорили в задании. Моделям нужно было взломать вымышленную систему и найти спрятанную в ней информацию.Однако из-за ошибки компанией Irregular, которая сотрудничает с Anthropic, модели получили доступ в интернет и приняли сайты реальных компаний за часть эксперимента, пояснили разработчики.В испытании Claude Opus 4.7 название выдуманной компании совпало с доменом реально существующей. Нейросеть нашла уязвимости в ее системе, благодаря чему получила учетные данные и доступ к базе с несколькими сотнями строк производственных данных.Этот случай стал единственным, когда модель продолжила атаку даже когда поняла, что это не часть эксперимента, подчеркнули в Anthropic.Claude Mythos 5 смог во время теста разместить в интернете вредоносный файл, который пробыл в открытом доступе около часа. За это время его успели скачать и запустить на 15 реальных компьютерах.Сначала нейросеть правильно оценила происходящее и назвала неприемлемым размещение вредоносных файлов в интернете. Но позже, по словам разработчиков, она убедила себя, что все еще находится в симуляции.Внутренняя тестовая модель не смогла достичь цели испытания и начала искать альтернативные варианты в интернете. После сканирования порядка девяти тысяч целей она смогла получить доступ к приложению реально существующей компании.На протяжении большей части эксперимента нейросеть была уверена, что находится в тестовой среде. Однако позже она самостоятельно пришла к выводу, что цель на самом деле реальна, и прекратила атаку.Как это удалось выявить. Anthropic начали проверку после того, как 21 июля о выходе своих ИИ-моделей из тестовой зоны сообщила компания OpenAI. Тогда нейросети смогли получить доступ к платформе Hugging Face.Выявить случаи, когда Claude взламывал реальные компании, удалось после анализа свыше 141 тысячи тестовых запусков, отметили разработчики. После этого, 23 июля, они остановили все эксперименты в сфере кибербезопасности.Помимо этого, 27 июля Anthropic уведомила пострадавшие компании, две из которых заявили, что не знали о взломе до обращения разработчиков ИИ.
Нейросеть Claude взломала системы трех компаний во время тестов по кибербезопасности — Новая газета Европа
Нейросеть Claude взломала системы трех компаний во время тестов по кибербезопасности










