전문가들은 마이크로소프트 코파일럿의 정체에 대해 끊임없이 질문을 던짐으로써 코파일럿을 해독하고 있습니다.

전문가들이 마이크로소프트 코파일럿이 끊임없이 자체 질문을 하는 과정에서 취약점을 발견했습니다. 이번 침해 사건의 자세한 내용을 확인하세요.

가장 중요한 사항들

  • Varonis 연구원들은 Copilot이 요청을 거부하는 이유를 설명하는 과정에서 보안 메커니즘이 드러나는 "메타 해킹" 기법을 발견했습니다. 이를 통해 연구원들은 Copilot의 방어 체계를 파악하고 우회하여 궁극적으로 민감한 데이터를 추출할 수 있었습니다.
  • 공격자는 피싱 이메일에 포함된 특정 URL 구조(예: `https://copilot.microsoft.com/?q=&autorun=1*`)를 악용하여 Copilot이 클릭 시 악성 명령을 실행하도록 만들 수 있으며, 이를 통해 Gmail 및 Drive와 같은 애플리케이션에서 민감한 데이터를 추출할 수 있습니다.
  • "웹 요약을 통한 영구 메모리 오염"(CoSnitch) 취약점은 공격자가 악성 웹 페이지를 요약하는 방식으로 Copilot의 영구 메모리에 명령을 삽입할 수 있도록 허용하여, 비밀번호 변경 및 장치 재등록에도 불구하고 시스템이 손상되지 않도록 만듭니다.

마이크로소프트의 AI 비서인 코파일럿이 연구원들에게 데이터 추출 방법을 알려주었고 , 연구원들은 실제로 성공했습니다 . 그 과정은 순탄치 않았고, AI가 "악"해지지도 않았지만, 다소 순진했다고 볼 수 있습니다.

보안 회사인 Varonis는 Copilot에서 발견한 보안 취약점( CoSnitch 라고 명명)에 대한 자세한 내용을 담은 새로운 보고서를 발표했습니다.

이름에서 알 수 있듯이, CoSnitch는 취약점의 본질을 강하게 암시합니다. CoSnitch는 마이크로소프트가 나중에 CVE-2026-24301로 분류하고 심각도 등급을 8.8/10(높음)으로 지정한 세 가지 보안 취약점 시리즈이며, 업데이트를 통해 패치되었습니다.

날 속일 순 없어, 그 이유를 정확히 알려줄게.

사이버 범죄자들은 ​​오랫동안 인공지능을 자신들의 무기로 활용해 왔으며, 이를 통해 설득력 있는 피싱 이메일을 제작하고, 악성 코드를 작성하고, 고가치 표적을 식별해 왔습니다. 이에 개발자들은 인공지능이 특정 작업을 수행하지 못하도록 하는 보안 조치를 구현함으로써 대응해 왔습니다.

보고서에서 바로니스 연구원은 연구자들이 코드의 오류를 찾거나 기존 취약점을 역분석하려 하지 않았다고 밝혔습니다. 대신, 그들은 단순히 AI와 대화를 나누었고, 질문을 거듭할수록 AI의 보안 장벽과 그 작동 방식을 파악했습니다. 그들은 이러한 기법을 "메타 해킹"이라고 불렀습니다.

코파일럿은 요청을 거부할 때마다 그 이유를 설명했고, 이를 통해 연구원들은 코파일럿의 작동 방식을 이해할 수 있었습니다. 바로니스가 지적했듯이, 그는 스스로를 "배신"한 셈입니다. 궁극적으로 이는 연구원들이 코파일럿의 방어 체계를 파악하고 이를 극복하는 방법을 알아내는 데 도움이 되었습니다. 이 실험은 코파일럿의 특징을 어떻게 탐구할 수 있는지를 보여줍니다.

그들은 이렇게 설명했습니다. "저항은 기법의 일부입니다. '이건 안 될 거야, 왜냐하면…'이라는 말은 모두 '왜'라는 질문에 대한 답을 찾아보라는 초대장과 같습니다. 모델을 이용하는 것이 아니라, 모델이 당신과 함께 작동하도록 조작하는 것입니다."

코파일럿과의 장시간 대화 끝에 연구원들은 의도치 않게 클릭 시 민감한 데이터 추출로 이어지는 일련의 상호 작용을 시작하는 URL을 만드는 방법을 알게 되었습니다.

인공지능을 애플리케이션에 연결할 때의 위험성

이처럼 Varonis는 "https://copilot.microsoft.com/?q=&autorun=1*"과 같은 URL을 생성하면 Copilot이 해당 링크를 클릭하는 것만으로 악성 명령을 실행하도록 만들 수 있다는 사실을 알게 되었습니다. 공격자는 예를 들어 피싱 이메일에 이 링크를 포함시켜 피해자가 클릭하도록 유도하고, AI가 모든 민감한 데이터를 공격자의 인프라로 전송하도록 명령할 수 있습니다.

하지만 이는 문제의 절반에 불과합니다. 이 환경에서 연구원들은 피해자들이 공동 세션 동안 코파일럿과 공유한 데이터만 추출할 수 있었습니다.

피해자가 Gmail, Drive, Calendar 등의 앱을 AI에 연결하는 순간 위험이 급증합니다. Varonis의 설명에 따르면 악성 명령은 Copilot에게 Gmail의 모든 이메일 주소, 이메일 메시지에 포함된 모든 암호 및 기타 민감한 정보, Drive 폴더에 저장된 모든 데이터, Calendar에 기록된 모든 일정을 추출하도록 지시할 수 있습니다. 이러한 위험은 Microsoft 365의 AI 기능을 현명하게 사용하는 방법을 이해하는 것이 얼마나 중요한지 보여줍니다.

CoSnitch 취약점 시리즈의 세 번째 부분은 "웹 요약을 통한 영구 메모리 오염"이라고 합니다. Varonis의 설명에 따르면, 공격자는 웹 페이지를 만들고 Copilot이 해당 페이지를 요약할 때 공격자의 지시 사항을 피해자의 영구 메모리에 삽입할 수 있습니다.

그들은 이 취약점이 "비밀번호 변경, 세션 취소 및 장치 재등록에도 불구하고 무기한 지속된다"고 경고했습니다. "간접 프롬프트 주입"으로 알려진 이 취약점은 완전히 새로운 것은 아니며, 이전에도 발견된 적이 있습니다. 이는 인공지능이 명령과 분석 대상 데이터를 구분하지 못하는 데서 비롯됩니다.

연구진은 마이크로소프트가 2025년 12월에 코스니치의 존재를 통보받았지만, 2026년 8월 중순이 되어서야 문제를 해결했다고 밝혔습니다. 안타깝게도 마이크로소프트가 이 문제를 어떻게 해결했는지는 알 수 없습니다. 다만 코파일럿 개발팀이 보안 메커니즘 작동 방식을 설명하지 않도록 지시받았을 가능성을 추측할 수 있는데, 이는 마이크로소프트가 코파일럿 기능에 대한 통제권을 유지하려는 노력 과 일맥상통합니다 . 코스니치의 근본적인 특성을 고려할 때, 마이크로소프트가 해결책을 비밀로 유지하는 것이 오히려 더 나은 선택이었을지도 모릅니다.

다행히도 이 취약점은 광범위하게 악용되지 않은 것으로 보입니다. Varonis는 악용 사례를 발견하지 못했습니다. 수정 사항은 서버 측에서 구현되었으므로 현재 사용자가 별도로 조치할 사항은 없습니다.

연구진은 이것이 코드상의 버그가 아니기 때문에 다른 AI 모델들도 동일한 기법에 취약할 수 있다고 경고했습니다. 그들은 "CoSnitch를 폭로한 새로운 메타 해킹 기법은 숨겨진 내부 메커니즘을 밝히기 위해 동일한 AI 논리를 사용하며, 자연어 인터페이스를 갖춘 모든 에이전트 플랫폼에 적용될 수 있다"고 결론지으며, 곧 더 자세한 연구 결과를 발표할 예정이라고 덧붙였습니다.




댓글이 닫혔습니다.