연구원들이 인공지능 로봇의 보안을 우회하는 간단하지만 놀라운 수법을 발견했습니다.

연구원들이 인공지능 로봇이 내장된 안전 장치를 우회하고 예측 불가능한 동작을 할 수 있게 하는 간단하지만 심각한 취약점을 발견했습니다. 이 심각한 결함에 대해 자세히 알아보세요.

가장 중요한 사항들

  • STING은 악의적인 공격 대상을 여러 차례의 대화를 통해 겉으로는 무해해 보이는 작은 단계로 나누는 것이 AI 보안 우회 성공률을 크게 높여 경우에 따라 두 배까지 끌어올릴 수 있다는 사실을 밝혀냈습니다.
  • AI 보안을 우회하는 것은 단순히 가상적인 위험이 아닙니다. 메타는 자사의 스마트 어시스턴트가 인스타그램 계정에 무단으로 접근할 수 있도록 하기 위해 간단한 사회공학적 기법을 사용했음을 인정했습니다.
  • 인공지능 시스템에 대한 공격은 여러 단계를 거치는 공격 도중 언어를 변경하면 성공률이 크게 높아지는데, 이는 이러한 시스템 설계 초기 단계부터 안전성 테스트를 포함해야 할 필요성을 강조합니다.

인공지능 에이전트 에게 계정 해킹을 요청하면 거의 틀림없이 거부할 것입니다. 하지만 EPFL 연구진은 기술적 능력보다는 인내심에 더 의존하는 더 쉬운 방법을 제시했습니다. 이번 연구 에 따르면 악의적인 목표를 겉보기에는 무해해 보이는 작은 요청들로 나누면 인공지능 에이전트가 평소라면 단호히 거부했을 작업을 완료하도록 속일 수 있다고 합니다( TechXplore 보도 ).

이는 최근 인공지능 브라우저가 조작되어 무해한 게임의 일부로 자격 증명 도용을 처리하도록 만든 '바이오쇼크' 사건을 반영합니다.

연구진은 어떻게 이러한 약점을 발견했을까요?

연구팀은 실제 공격자의 공격 방식을 모방하도록 설계된 자동화 테스트 도구인 STING(Sequential Testing of Illicit N-step Goal Execution, 불법적인 N단계 목표 실행에 대한 순차적 테스트)을 개발했습니다. STING은 악의적인 대상을 직접 식별하는 대신, 사전에 계획을 세우고 해당 대상을 일련의 작고 겉보기에는 무해해 보이는 단계로 나누어 여러 차례의 대화를 통해 목표를 달성합니다.

인공지능 에이전트의 오작동을 유도하기

연구진은 ChatGPT , Gemini, Cloud를 포함한 주요 AI 모델을 대상으로 176개의 유해 시나리오에 걸쳐 이 접근 방식을 테스트했습니다.

각 AI 에이전트는 웹 브라우징, 이메일 전송, 여러 단계를 거치는 작업 완료 등 도구를 사용하는 에이전트로서 테스트되었습니다.

여러 단계를 거치는 점진적인 조작 방식이 직접적인 단일 요청 시도보다 훨씬 더 성공적이었습니다. 어떤 경우에는 요청을 더 작은 단계로 나누었을 때 모델이 악의적인 작업을 완료할 확률이 두 배나 높아졌습니다. 이러한 결과는 일반 사용자조차도 정교하게 조작된 주장만으로 AI 보안 조치를 우회할 수 있다는 것을 보여주는 별도의 연구 결과와 일치합니다.

왜 이것이 중요한가요?

연구원들이 제기한 우려는 단순히 가설에 그치는 것이 아닙니다. 메타는 지난 6월 공격자들이 악성코드나 해킹 도구가 아닌 단순한 사회공학적 기법을 사용하여 자사의 AI 지원 도우미를 속여 인스타그램 계정에 무단 접근 권한을 획득했다고 인정했습니다.

AI 챗봇

연구진은 처음에 훈련 데이터가 부족한 언어에서 공격이 더 효과적일 것으로 예상했습니다. 그러나 결과는 테스트한 7개 언어 모두에서 공격 완료율이 거의 일관되게 유지되었음을 보여주었습니다. 하지만 중요한 예외를 발견했는데, 여러 단계로 이루어진 공격 도중에 언어를 변경했을 때 성공률이 급격히 증가한 것입니다.

수석 연구원인 아유시 쿠마르 타룬은 초기 단계에서 안전성 테스트를 실시하는 것이 중요하며, 이를 인공지능 시스템 설계의 핵심 요소로 삼아야 한다고 강조합니다. 문제가 발생한 후에 사후 대응책으로 안전성 테스트를 추가하는 것은 더 이상 충분하지 않으며, 특히 이러한 시스템이 더욱 강력해지고 실제 응용 분야에 통합될수록 더욱 그렇습니다.

댓글이 닫혔습니다.