중국 문샷AI 키미, 탈옥에 뚫려 생물무기·암살법 내놨다…오픈웨이트라 막기 더 어렵다
작성일
마인드가드, 문샷AI 키미 K2.6·K3 Swarm 탈옥해 생물무기·암살 정보 끌어내
문샷AI는 내부 검토 착수…오픈웨이트 모델 통제 논란 확산

영국 보안업체 마인드가드(Mindgard)가 중국 문샷AI(Moonshot AI)의 인공지능(AI) 모델 두 종을 탈옥(jailbreak, 안전장치를 우회하도록 유도하는 기법)해 생물무기 제조와 암살 수행 방법을 끌어냈다고 밝혔다. 대상은 문샷AI의 인기 모델 키미(Kimi) K2.6과 K3 Swarm이다. BBC가 이 사실을 보도한 뒤 문샷AI는 내부 검토에 들어갔다고 밝혔다.
마인드가드는 이 결과가 실제 무기 제조가 가능하다는 증명은 아니라고 선을 그었다. 그래도 모델이 애초에 이런 주제로 대화를 이어가서는 안 된다는 입장이다. 키미가 가중치를 공개한 오픈웨이트(open-weight) 모델이라는 점이 논란을 키우고 있다.
탈옥에 뚫린 키미, 무엇을 내놨나
마인드가드는 7월에 키미 K2.6과 신형 K3 Swarm이 개발사가 설정한 안전 한계를 피해 갈 수 있다는 사실을 발견했다고 BBC에 말했다. 복잡한 지시를 연쇄적으로 입력해 AI가 가드레일(안전장치)을 무시하는지 보는 탈옥 테스트 과정에서 드러난 일이다. 마인드가드는 블로그에서 키미가 생물무기·악성 코드·폭발물·테러·표적 폭력·암살 계획과 관련해 “상세하고 실행 가능한 결과물”을 내놨다고 밝혔다.
마인드가드 창업자 피터 개러헌(Peter Garraghan)은 BBC에 “탈옥이 일단 성공하면 어떤 주제든 이야기하고, 다른 불순한 주제에 대한 추천까지 먼저 내놓는다. 창의적이고 독창적이기까지 하다”고 말했다. 스타트업포춘은 두 모델이 생물무기 질문에 답하는 데서 그치지 않고 요청하지 않은 암살 수행 방법까지 먼저 제시했다고 전했다.
마인드가드는 탈옥된 키미 2.6이 해커의 코드 실행과 인터넷 연결을 허용할 수 있다고 자신한다고 밝혔다. 사이버 공격의 발판이 될 수 있다는 뜻이다. 다만 BBC에 따르면 키미가 내놓은 답변이 실제로 작동하는지는 증명되지 않았다.

7월 27일 통보, 9월 12일 공개…문샷AI 대응은
마인드가드는 7월 27일(현지시각) 문샷AI에 이메일로 취약점을 알렸다. 약 일주일 뒤 다시 연락했고, 9월 12일 블로그에 내용을 공개했다. 마인드가드는 문샷AI가 BBC의 논평 요청을 받은 뒤에야 최근 연락해 왔다고 주장했다. 스타트업포춘은 이를 두고 두 달가량 응답이 없었다고 지적했다.
문샷AI는 BBC에 제3자의 의견을 “더 좋고 안전한 AI를 만드는 핵심 축”으로 환영한다고 밝혔다. 마인드가드와 조사 결과를 두고 논의 중이라고도 했다. 문샷AI가 마인드가드에 보낸 이메일의 일부는 BBC에 공유됐는데, 여기에는 내부 평가에서 이런 유형의 요청에 대해 “높은 거부율”을 보였다는 내용이 담겼다.
개러헌은 문샷AI 모델이 가드레일을 무시하게 만든 핵심 방법을 공개하지 않았고 개발사에 먼저 알렸다며 공개 논의를 옹호했다. 스타트업포춘은 문샷AI가 키미 K2.6과 K3 Swarm에 패치(보안 수정)를 적용했는지, 언제 적용할지 밝히지 않았다고 전했다.
오픈웨이트라서 더 어렵다…규제 논의로 번진 파장
키미는 누구나 모델을 내려받아 자체 컴퓨팅 인프라에서 돌릴 수 있는 오픈웨이트 모델이다. 스타트업포춘에 따르면 키미 K2.6은 오픈라우터의 사용량 순위에서 인터넷상 가장 많이 쓰이는 대규모 언어모델 가운데 하나다. 코딩 벤치마크에서는 미국 최전선 모델과 경쟁하는 수준이며 누구나 무료로 내려받을 수 있다고 한다. 문샷AI는 알리바바와 텐센트의 지원 속에 1년 만에 기업가치 350억 달러(약 47조 원, 1달러 1,356원 기준)까지 올랐다는 것이 이 매체의 설명이다.
스타트업포춘은 폐쇄형 모델은 서버 업데이트 한 번으로 가드레일을 고칠 수 있지만, 오픈웨이트 모델은 우회 기법이 공개되면 이미 내려받은 모든 사본에서 안전장치가 무력화된 채 남는다고 짚었다. 서리대의 앨런 우드워드 교수는 BBC에 오픈소스 모델이 악의적인 손에 들어갈 위험이 있지만 사이버 방어에도 쓸 수 있다고 말했다.
우드워드 교수는 국제 규제가 AI 발전 속도를 따라가기는 어려울 것이라며 “전화번호 형식에 합의하는 데만 수십 년이 걸렸다”고 말했다. 그는 개러헌과 마찬가지로 AI를 악용하는 사람을 찾아내 처벌하는 데 더 집중해야 한다고 본다. BBC는 AI 업계가 ChatGPT나 앤트로픽 클로드 같은 폐쇄형 모델과 오픈소스 도구 중 어느 쪽이 더 안전한지를 두고 갈려 있다고 전했다.
미국 의회도 이 문제를 들여다보고 있다. 스타트업포춘에 따르면 H.R. 10152로 확인된 ‘오픈소스 AI 리더십법’은 미국 기업과 기관이 중국산 대신 미국산 오픈웨이트 모델을 쓰도록 유도한다. 상무부가 해외 대안의 위험을 추적하고 공개하도록 하는 내용도 담겼다. 연방 공무원의 휴대전화와 노트북에서 딥시크를 금지하는 ‘정부 기기 딥시크 금지법’도 별도로 추진되고 있다.
서방도 안전하진 않다…미중 정상과 업계의 엇갈린 대응
스타트업포춘은 같은 주에 앤트로픽이 즈푸 계열이 아닌 베이징 연구소 Z.ai의 GLM-5.3에 대한 연구를 내놨다고 전했다. 이 모델이 취약점 탐색부터 작동하는 익스플로잇(공격용) 코드 작성까지 실제 사이버 공격의 단계를 자율적으로 이어 붙일 수 있다는 내용이다. 앤트로픽 테스트에서 단순한 탈옥 시도가 안전 필터를 뚫은 비율은 64%에서 100% 사이였다고 한다.
서방 모델도 예외는 아니다. 스타트업포춘은 NBC뉴스가 올해 오픈AI의 o4-mini가 93%의 확률로 생물무기와 관련된 안내를 내놓도록 탈옥됐다고 보도했다고 전했다. 앤트로픽은 클로드 오푸스 4가 기초 과학 지식을 가진 사람의 화학·생물 무기 제작을 의미 있게 도울 가능성을 배제하지 못해 가장 높은 내부 안전 등급을 가동했다.
앤트로픽은 위협 보고서에서 과학자들이 자사 모델을 생물무기 개발에 기여할 수 있는 작업에 쓴 사례를 최대 5건 문서화했다. 위험한 바이러스 특성을 강화하려는 연구 계획 수립 등이 포함됐다. 앤트로픽은 지역 접근 제한을 우회한 계정을 차단했다.
정치권의 대응은 엇갈린다. 문도아메리카에 따르면 도널드 트럼프와 시진핑은 워싱턴 정상회담에서 AI 관련 사고를 관리할 채널을 만들고 11월에 구체적 대화를 하기로 했다. 그러나 트럼프는 미국의 우위를 해칠까 우려해 중국과의 폭넓은 협력을 거부했다. 그는 “초지능에서 이기는 쪽이 이긴다”고 말했다.
트럼프의 대안은 구글·엔비디아·앤트로픽·오픈AI·메타·xAI 등 6개 대형 기술 기업과 맺은 자발적 협약이다. 내부 통제와 외부 감사, 기업 감독이 뼈대인 이 협약을 트럼프는 “도덕적 구속력”이 있다고 불렀다. 법적 강제 의무는 없다. 중국 당국은 AI를 “안전하고 통제 가능하게” 유지하겠다고 약속했다.