미스트랄, Shieldstral로 7배 큰 AI에 필적
작성일
미스트랄, 30억 파라미터 Shieldstral 공개
7배 큰 AI에 필적…정책 바꿔도 재학습 없이 검열

미스트랄AI(Mistral AI)가 콘텐츠 검열 전용 AI 모델 Shieldstral을 공개했다. 30억 개 파라미터(3B) 규모의 이 모델은 텍스트와 이미지를 동시에 판별하는 오픈웨이트 멀티모달 안전 분류기다. 미스트랄은 2026년 8월 4일(현지시각) Shieldstral을 허깅페이스(Hugging Face)에 아파치 2.0(Apache 2.0) 라이선스로 공개했다고 밝혔다. 미스트랄에 따르면 이 모델은 자사보다 최대 7배 큰 오픈 가드 모델들과 텍스트 안전성에서 동등하거나 더 나은 성적을 냈고, 멀티모달 검열에서는 새로운 최고 기록을 세웠다. 재학습 없이 자연어로 작성한 정책을 그대로 입력받아 판정 기준을 즉시 바꿀 수 있다는 점이 가장 큰 특징이다.
정책을 “질문”으로 바꿔 판정하는 구조
기존 가드레일 모델은 유해 카테고리 목록을 가중치에 고정해 학습한다. 서비스 성격이 바뀌면 모델을 다시 학습해야 했다는 뜻이다. 사이버보안 연구 도구에서는 괜찮은 내용이 정신건강 플랫폼에서는 위험할 수 있는데도, 기존 방식으로는 같은 기준을 적용할 수밖에 없었다.
Shieldstral은 이 문제를 이진 질의응답 방식으로 풀었다. 요청은 평가 맥락과 엄격도를 담은 <Instruct>, “이 콘텐츠가 신체적 폭력을 조장하는가” 같은 예·아니오 질문인 <Query>, 판정 대상 프롬프트·응답·이미지를 담은 <Document> 세 부분으로 구성된다. 모델은 “yes”와 “no” 토큰의 로짓(logit)만 읽어 소프트맥스(softmax)로 정규화한 연속 점수를 내놓고, 이를 0.5 기준으로 이진 판정한다. 프롬프트 분류, 응답 검열, 거부 탐지, 유해성 탐지를 하나의 문제로 통합한 것이다. 미스트랄은 Ministral-3-3B를 기반으로 픽스트랄(Pixtral) 비전 인코더를 결합해 이미지 입력을 처리하도록 했고, 학습 컨텍스트는 3만2000 토큰이라고 모델 카드에 명시했다.

5410만 건 데이터로 큰 모델을 앞선 비결
미스트랄이 공개한 기술보고서에 따르면 Shieldstral은 약 5410만 건의 학습 샘플로 훈련됐다. 공개 텍스트 데이터 4520만 건, 합성 대조 텍스트 440만 건, 멀티모달 샘플 450만 건으로 구성된다. 서로 다른 분류체계를 쓰는 공개 안전 데이터셋들을 동일한 지시-질의-문서 형식으로 통일하고 출처별로 엄격도를 다르게 보정한 것이 핵심이었다.
미스트랄은 모델이 특정 정책 목록을 외우는 대신 정책 간 미묘한 경계를 구분하도록 훈련했다고 설명했다. LLM을 활용해 안전한 텍스트를 의도적으로 재작성해, 한 정책만 위반하고 유사한 다른 정책은 위반하지 않는 대조쌍을 대량으로 만든 방식이다. 최종 모델은 공개 데이터로 보정한 체크포인트, 생성 데이터로 정책 구분력을 더한 체크포인트, 베이스 지시 모델을 구면 선형 보간(SLERP) 방식으로 병합해 완성했다.
16개 벤치마크 성적표, GPT-OSS-Safeguard-20B와 견줘
미스트랄은 Shieldstral을 10개 오픈 베이스라인 모델과 16개 벤치마크에서 비교했다. 평가 샘플은 모두 학습 데이터에서 제외된 것들이다. 텍스트 안전성 벤치마크 평균 F1은 84.9%로, 자사보다 훨씬 큰 GPT-OSS-Safeguard-20B와 동률을 이루며 40억~200억 파라미터 모델 중 1위를 차지했다. 멀티모달 안전성에서는 평균 F1 83.8%로 차순위인 OmniGuard-7B(77.6%)를 앞섰고, 이미지 안전성 벤치마크 3개 중 2개에서 선두에 섰다.
정책 적응력을 평가하기 위해 별도로 만든 벤치마크에서는 F1 91.3%를 기록했다. 답을 내기 전에 긴 추론 과정을 거치는 GPT-OSS-Safeguard-20B의 94.1%에는 못 미쳤다. 다만 이 벤치마크는 학습 때 쓴 분류체계와 다른 체계를 사용하고, 학습 데이터와는 다른 LLM으로 생성·검증했기 때문에 단순 암기로는 높은 점수를 받을 수 없는 구조라고 미스트랄은 설명했다. 다국어 성능은 균일하지 않다. Shieldstral은 12개 언어를 지원하지만 기술보고서 부록에는 아랍어와 인도네시아어 프롬프트 분류에서 여러 베이스라인 모델에 뒤처진다는 결과가 담겼다. 미스트랄도 이를 언어별 커버리지 불균형이라는 한계로 명시했다. 이번 수치는 모두 미스트랄이 자체 선정한 벤치마크로 측정한 결과라는 점도 감안할 필요가 있다.
미스트랄의 세 번째 검열 모델, 처음으로 오픈웨이트
Shieldstral은 미스트랄이 내놓은 세 번째 콘텐츠 검열 모델이다. 미스트랄은 2024년 11월 7일(현지시각) 9개 고정 카테고리를 11개 언어로 검열하는 호스팅형 텍스트 분류기를 첫 번째 콘텐츠 검열 API로 선보였다. 이 모델은 자사 챗봇 르 챗(Le Chat)의 검열 시스템으로도 쓰였다. 이후 두 번째 호스팅 버전이 나왔지만 두 모델 모두 가중치를 공개하지는 않았다.
Shieldstral은 이 흐름을 뒤집는다. 고정된 카테고리 대신 요청과 함께 정책이 전달되고, 모델 자체도 내려받을 수 있다. 미스트랄은 엔비디아(NVIDIA) 등이 함께 참여하는 오픈 시큐어 AI 얼라이언스(Open Secure AI Alliance) 창립 멤버로서 이번 모델을 공개했다고 밝혔다. Shieldstral을 다룬 기술보고서는 2026년 7월 28일(현지시각) 아카이브(arXiv)에 먼저 게재됐고, 모델 카드와 가중치는 2026년 8월 4일(현지시각)에 함께 공개됐다.