프랑스 인공지능 기업 Mistral AI가 2026년 10월 6일 현지시각 Mistral Large 4를 공개했다. 별칭은 ‘le Chonk’로, 전체 1조 개 매개변수 가운데 490억 개를 활성화하는 전문가 혼합 방식 모델이다. 회사는 코딩 에이전트, 지식 업무, 사이버 보안, 시각적 위치 추론 등을 주요 평가 영역으로 제시했다.
프리뷰 API 우선 제공
모델 ID는 mistral-large-4-0이다. Mistral Studio에서 프리뷰 API를 이용할 수 있으며, API 요금은 토큰 100만 개당 입력 1.36달러, 출력 4.18달러다. 공개 시점에는 가중치가 배포되지 않았고, Mistral AI는 이달 말까지 공개할 계획이라고 밝혔다.
가중치 공개 예정일은 2026년 10월 27일로, 약 3주간의 시험 기간을 거친다. 모델은 Nvidia Grace Blackwell GPU 4,000개로 약 두 달 동안 훈련됐으며, 160개 이상의 언어와 멀티모달 입력·텍스트 전용 출력을 지원하고 맞춤형 Mistral 라이선스가 적용된다. 현재는 공개 프리뷰와 가드레일이 적용된 엔드포인트로만 접근할 수 있다. Mistral AI는 신뢰할 수 있는 파트너 및 정부와 협력하고 안전성 시험을 마친 뒤 가중치를 내놓을 예정이며, 이는 모델이 방어에는 쓰이되 악의적 공격에는 쓰이지 않도록 하기 위한 것이다.
Mistral AI는 9월 투자 유치에서 210억 유로의 기업가치로 30억 유로를 조달했다.
코딩·업무 자동화 평가
Mistral AI가 발표한 DeepSWE v1.1 점수는 61.7%로 DeepSeek V4 Pro 0813보다 높았다. Terminal Bench 4.0에서는 28.3%로 Qwen3.8 Max를 앞섰고, SWE-Atlas-QnA에서는 59.4%로 회사가 추적한 경쟁 모델보다 높은 점수를 기록했다. 회사 발표 기준 Coding Agent Index 종합 점수는 49.8%로 DeepSeek V4 Pro와 Qwen3.8 Max보다 높았다.
다만 Surge AI의 코딩 블라인드 인적 평가에서는 Mistral Large 4가 5점 만점에 3.74점을 받아 Claude Opus 5의 4.22점보다 낮았다. DeepSWE v1.1에는 회사 발표와 다른 수치도 있다. 이 집계에서 Mistral Large 4는 62%, GLM-5.3은 61%, DeepSeek V4 Pro 0813은 57%, Qwen 3.8 Max는 51%였다. GPT-6 Astra, Gemini 3.8 Flash, Claude Opus 5는 공개된 최적 설정 기준 약 74%를 기록해 Mistral Large 4의 62%보다 높았다.
회사 발표에서 AutomationBench 점수는 59.9%로 Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro보다 높았고, 지식 업무를 측정하는 AA-Briefcase Elo 점수는 1,393으로 DeepSeek V4 Pro를 앞섰다. Harvey Legal Agent 비교에서는 Mistral Large 4 15%, Kimi K3 12.92%, GLM-5.3 8.33%라는 수치가 제시됐고, Finch Finance에서는 Mistral Large 4와 DeepSeek V4 Pro 0813이 각각 67%로 같았다.
보안·과학·시각 평가
Mistral AI 발표 기준 Mistral Large 4는 AA Cyber Index에서 세계 상위 5위 안에 들었다. Cybench 전체 점수는 93%로 주요 오픈 웨이트 모델보다 높았다. B3 Security Benchmark에서는 공격 저항성 점수 93.3%, KORA Benchmark의 책임 있는 대응 평가는 2점 만점에 1.691점으로 GLM-5.2, GLM-5.3, Kimi 모델보다 높았다고 회사는 밝혔다.
시각적 위치 추론 평가인 Dense 200에서 회사가 발표한 점수는 42%로 GPT-6-Astra의 41%보다 높았다. DIOR-RSVG 시각 평가에서는 73%를 기록했다. Mistral AI는 SciCode-Verified에서 Mistral Large 4가 오픈 웨이트 모델 가운데 최고 수준이라고 설명했다. 아르튀르 멘슈 Mistral AI 최고경영자는 “오늘 발표하는 모델은 사이버를 포함한 일부 측면에서 중국 모델보다 앞선다”고 말했지만, 어떤 중국 모델과 어떤 방식으로 비교했는지는 밝히지 않았다.
독립 평가와 공개 단계의 한계
독립 평가 기관 Vals AI의 Vals Index에서 Mistral Large 4는 48.05% ± 1.11로 전체 44개 모델 중 32위였다. Harvey Legal Agent에서는 15.83% ± 2.96으로 75개 중 6위, Finance Agent v2에서는 54.68% ± 0.58로 75개 중 22위였다. Tax Agent Bench는 63.29% ± 3.23으로 66개 중 25위, EMB는 56.21% ± 3.22로 71개 중 43위, Vibe Code Bench v1.1은 78.40% ± 3.55로 109개 중 25위였다.
Artificial Analysis Intelligence Index에서 Mistral Large 4는 38.4점으로 오픈 웨이트 모델 8위에 올랐다. 같은 지수에서 다른 오픈 웨이트 모델의 점수는 Xiaomi MiMo-V2.6-Pro 46.3점, Z.ai GLM-5.3 44.8점, Moonshot AI Kimi K3 43.6점, DeepSeek V4 Pro 36.0점, GLM-5.2 33.7점으로 제시됐다. 한국의 Motif 3은 33.6점으로, 그전까지 중국 밖에서 가장 강한 모델이었다. 같은 지수에서 폐쇄형 모델인 Claude Opus 5.5는 57.6점, GPT-6 Astra는 52.7점, Gemini 4 Argon은 52.6점으로 Mistral Large 4보다 높았다. Artificial Analysis가 제시한 Mistral Large 4의 작업당 비용은 1.13달러(1.00유로)였다.
Mistral AI는 이번 프리뷰에 적용되는 강화학습이 아직 진행 중이며 모델이 포화 징후를 보이지 않아 추가 개선 여지가 크다고 밝혔다. 피에르 스톡 Mistral AI 과학 담당 부사장은 사용한 연산량이 폐쇄형 경쟁 모델보다 상당히 적고 중국 경쟁 모델보다 약 2~3배 적다고 설명했다. 일부 벤치마크 결과와 일부 경쟁 모델의 정확한 점수는 아직 공개되지 않았다.
