2026년 7월 27일 현재 인공분석 지능지수(Artificial Analysis Intelligence Index, AAII) v4.1의 최고점은 Claude Opus 5다. 그러나 비용 효율성 시장까지 보면 중국 모델의 존재감이 뚜렷하다. Kimi K3는 최상위 성능 구간에 들어왔고, GLM-5.2는 51점 구간의 개방형 가중치 대안, DeepSeek V4 Pro와 MiniMax-M3는 44점 구간의 저비용 후보로 자리 잡았다.
따라서 이번 비교는 ‘지능점수 상위 10개’를 그대로 순위표로 옮기지 않는다. 일정한 품질 하한선을 넘고, 최고 성능·파레토 전선·개방형 가중치·멀티모달·대량 처리 가운데 하나 이상의 전략적 의미가 있는 모델을 대표 비교군으로 선정했다. 국가별 할당이 아니라 실제 구매 후보의 폭을 보존하기 위한 방식이다.
EDITORIAL METHOD
이 글의 10개 모델은 절대 순위가 아니라 대표 비교군이다. AAII v4.1 39점 이상이면서 작업당 비용을 공개 비교할 수 있는 모델을 먼저 모은 뒤, 최고 성능, 비용 대비 성능의 파레토 전선, 개방형 가중치의 전략성, 멀티모달 지원, 대량 처리 경제성 중 하나 이상이 분명한 모델을 남겼다. 같은 회사의 유사 설정은 줄였지만, 동일 계열이라도 비용 계층이 뚜렷하게 다르면 별도 후보로 유지했다.
LLM 모델 비교에서 ‘객관적 기준’은 무엇을 뜻하나
AAII v4.1은 에이전트 업무 34%, 코딩 24%, 과학 추론 24%, 일반 지식 18%를 가중 평균한다. 실제 파일 산출 업무, 은행 업무 시뮬레이션, 터미널 작업, 과학 코딩, 장문 추론, 지식 정확도와 환각 억제 등을 한 점수로 묶는다. 단일 수학 시험이나 사용자 선호 투표보다 기업 업무에 가까운 요소가 많다는 장점이 있다.
다만 이 지수는 영어 텍스트 중심이다. 한국어 품질, 이미지·영상 입력, 음성 처리, 특정 산업의 규정 준수, 국내 클라우드 가용성은 별도로 검증해야 한다. 이 글의 순위가 모든 조직의 구매 순위가 될 수 없는 이유다.
글로벌 프런티어·고효율 대표 모델 10개는 무엇인가
아래 표의 ‘작업당 비용’은 AAII 평가 작업 한 건을 완료하는 데 든 가중 평균 비용이다. 실제 기업의 청구 금액과 같지는 않지만, 답변·추론·캐시·입력 토큰을 함께 반영하므로 단순 API 단가보다 경제성을 입체적으로 보여준다. 표의 순서는 지능지수 기준이며, ‘대표 순서’가 구매 우선순위를 뜻하지는 않는다.
| 대표 순서 | 모델 | 개발사·지역 | AAII | 작업당 비용 | 비교 역할 | 실무 해석 |
|---|---|---|---|---|---|---|
| 1 | Claude Opus 5 | Anthropic·미국 | 61 | $2.03 | 최고 성능 기준점 | 오류 비용이 매우 높은 복합 지식 업무 |
| 2 | GPT-5.6 Sol | OpenAI·미국 | 58 | $1.04 | 최상위 균형형 | 최고점에 가까운 품질과 비용 절충 |
| 3 | Kimi K3 | Moonshot AI·중국 | 57 | $0.94 | 중국 최상위 프런티어 | 고성능·장문·멀티모달 후보 |
| 4 | Grok 4.5 high | SpaceXAI·미국 | 54 | $0.31 | 근접 프런티어 저비용 | 중간 난도 반복 업무의 비용 후보 |
| 5 | GLM-5.2 max | Z.ai·중국 | 51 | $0.32 | 개방형 가중치 파레토 후보 | 자체 배포와 빠른 처리의 균형 |
| 6 | GPT-5.6 Luna | OpenAI·미국 | 51 | $0.21 | 상용 대량 처리형 | 기존 OpenAI 운영환경의 저비용 계층 |
| 7 | Gemini 3.6 Flash | Google·미국 | 50 | $0.50 | 속도·멀티모달 비교축 | 텍스트 외 입력과 응답시간이 중요한 업무 |
| 8 | DeepSeek V4 Pro max | DeepSeek·중국 | 44 | $0.04 | 초저비용 개방형 추론 | 대량 분석과 단계적 상위 모델 전환 |
| 9 | MiniMax-M3 | MiniMax·중국 | 44 | $0.12 | 저비용 멀티모달 | 이미지·영상 입력과 대량 처리의 대안 |
| 10 | Qwen3.7 Plus | Alibaba·중국 | 39 | $0.21 | 중국 상용 멀티모달 | 중국어권·장문·도구 사용 비교 후보 |
작업당 비용은 Artificial Analysis가 각 모델과 제공자에서 측정한 값으로, 제공자·캐시·추론 설정에 따라 달라질 수 있다. MiniMax-M3와 Qwen3.7 Plus는 해당 제공자 기준이며, 공개 순위가 실제 한국어 업무의 성공률을 대신하지 않는다.
토큰 가격만 보면 왜 비용을 잘못 읽게 되나
모델 비용은 입력 단가와 출력 단가의 합으로 끝나지 않는다. 추론 모델은 답을 내기 전 내부적으로 더 많은 토큰을 사용하고, 에이전트 업무에서는 도구 호출과 재시도가 반복된다. 같은 100만 토큰 가격이라도 한 번에 일을 끝내는 모델과 여러 차례 되돌아가는 모델의 최종 비용은 크게 다를 수 있다.
Claude Opus 5는 61점에 작업당 $2.03이지만, Kimi K3는 57점에 $0.94, GLM-5.2는 51점에 약 $0.32다. 더 낮은 품질 하한선을 허용하면 DeepSeek V4 Pro는 44점에 약 $0.04, MiniMax-M3는 같은 44점 구간에서 약 $0.12까지 내려간다. 최고점에서 몇 점을 포기할 수 있는지가 비용 구조를 크게 바꾼다.
COST FORMULA
실제 업무 비용 = 입력 토큰 + 출력·추론 토큰 + 도구 호출 + 재시도 + 캐시 쓰기 − 캐시 절감 + 사람 검수 시간. API 단가표는 이 식의 일부만 보여준다.
중국 모델을 포함하면 비용 효율성 시장은 어떻게 달라지나
첫째, 중국 모델은 더 이상 저가형 보조 모델만을 뜻하지 않는다. Kimi K3는 최상위 프런티어 구간에 들어왔고, GLM-5.2는 개방형 가중치 모델 가운데 51점과 낮은 작업당 비용을 함께 확보했다. 성능 경쟁과 개방형 생태계가 같은 축에서 움직이기 시작했다.
둘째, 40점대의 비용 곡선은 DeepSeek와 MiniMax가 크게 낮춘다. DeepSeek V4 Pro와 MiniMax-M3는 최고 성능 모델을 대체하는 후보가 아니라, 대량 분석·초안·분류를 먼저 처리하고 실패한 요청만 상위 모델로 넘기는 라우팅 계층에 가깝다.
셋째, Qwen과 MiniMax처럼 멀티모달 입력을 지원하는 중국 모델은 텍스트 단가만으로 평가하기 어렵다. 이미지·영상·장문 문맥을 한 API에서 처리할 때 줄어드는 파이프라인 비용까지 자체 업무 평가에 포함해야 한다. 이 지점에서 공개 벤치마크는 구매 후보를 좁히는 도구일 뿐, 최종 결론이 아니다.
한국 기업은 어떤 모델을 어디에 배치해야 하나
최고 모델 하나를 정해 전사에 배포하는 방식은 비용과 품질을 동시에 놓치기 쉽다. 업무의 오류 비용, 처리량, 응답 시간, 데이터 위치를 기준으로 최소 세 계층을 나누는 편이 현실적이다.
| 업무 계층 | 예시 | 우선 비교군 | 운영 조건 |
|---|---|---|---|
| 고위험·고가치 | 의사결정 보고서, 복잡한 코딩, 법무 검토 보조 | Claude Opus 5, GPT-5.6 Sol, Kimi K3 | 사람 승인, 근거 추적, 실패 시 상위 모델 재검증 |
| 중간 난도·반복 | 시장 조사, 제안서 초안, 운영 분석 | Grok 4.5, GLM-5.2, Gemini 3.6 Flash, Qwen3.7 Plus | 업무별 정답 세트, 비용 상한, 재시도 횟수 제한 |
| 대량·저위험 | 분류, 요약, 메타데이터 생성, 1차 응답 | GPT-5.6 Luna, DeepSeek V4 Pro, MiniMax-M3 | 신뢰도 임계값, 샘플 검수, 민감정보 통제 |
CHECKLIST
- 한국어 업무 50~100개로 자체 평가 세트를 만들었는가?
- 정답률이 아니라 한 번에 완료한 비율과 재시도 횟수를 기록하는가?
- 입력·출력·추론·도구 호출 비용을 한 업무 단위로 합산하는가?
- 낮은 비용 모델이 실패했을 때 상위 모델로 넘기는 기준이 있는가?
- 데이터 위치, 보존 기간, 모델 제공 지역을 구매 전에 확인했는가?
다음 순위보다 먼저 확인할 지표는 무엇인가
벤치마크 1점 차이는 실제 업무에서 뒤집힐 수 있다. 다음 분기에 볼 지표는 새 모델의 발표 횟수가 아니다. 한국어 업무 성공률, 업무당 출력 토큰, 평균 재시도 횟수, 첫 응답 지연, 캐시 적중률, 사람 검수 시간을 같은 대시보드에서 확인해야 한다.
현재 시장의 핵심 변화는 최고 성능 자체보다 선택 가능한 가격대가 촘촘해졌다는 데 있다. 조직이 먼저 정할 것은 1위 모델이 아니라 업무별 최소 품질과 최대 허용 비용이다. 이 두 기준이 있어야 모델 순위가 구매 결정으로 바뀐다.
2026년 7월 27일 기준 최고 성능은 Claude Opus 5지만, 글로벌 비용 효율성 시장은 Kimi K3, GLM-5.2, DeepSeek V4 Pro, MiniMax-M3, Qwen3.7 Plus까지 함께 봐야 설명된다. 중국 모델은 최상위 성능, 개방형 가중치, 초저비용, 멀티모달이라는 서로 다른 구간에서 경쟁하고 있다. 한국 기업은 공개 영어 벤치마크를 출발점으로 삼되, 한국어 성공률·데이터 위치·라이선스·지원 지역·총운영비용을 자체 검증해야 한다.
FAQ
자주 묻는 질문
Q. 현재 가장 성능이 높은 LLM은 무엇인가요?
AAII v4.1 기준으로는 Claude Opus 5가 61점으로 가장 높다. 다만 이 지수는 영어 텍스트와 에이전트 업무 비중이 높으므로, 한국어·멀티모달·특정 산업 업무에서는 별도 평가가 필요하다.
Q. 비용 효율성이 가장 좋은 모델은 무엇인가요?
하나의 답은 없다. 최상위 품질이 필요하면 GPT-5.6 Sol이나 Kimi K3, 51점 구간에서는 GLM-5.2와 GPT-5.6 Luna, 44점 구간에서는 DeepSeek V4 Pro와 MiniMax-M3를 비교할 수 있다. 품질 하한선과 실패 비용을 먼저 정해야 경제성을 판단할 수 있다.
Q. 중국 모델은 이번 비교에서 어떻게 반영했나요?
Kimi K3, GLM-5.2, DeepSeek V4 Pro, MiniMax-M3, Qwen3.7 Plus를 서로 다른 성능·비용·배포 구간의 대표 후보로 포함했다. 다만 중국 모델이라는 이유만으로 가점을 주지 않았으며, 공개 지능지수와 작업당 비용, 개방성 또는 멀티모달 전략성을 기준으로 선정했다.
Q. API 토큰 가격만 비교하면 안 되나요?
충분하지 않다. 추론 토큰, 도구 호출, 재시도, 캐시, 사람 검수 시간이 최종 비용을 바꾼다. 조직은 한 요청의 가격보다 한 업무를 성공적으로 끝낸 총비용을 측정해야 한다.
TERMINOLOGY
본문에 나오는 주요 용어
| 용어 | 뜻 | 실무 포인트 |
|---|---|---|
| AAII | 인공분석 지능지수 | 영어 텍스트 중심의 종합 지표이므로 한국어 성능을 대신하지 않는다. |
| 작업당 비용 | 평가 작업 한 건을 끝낸 평균 비용 | 토큰 단가뿐 아니라 모델이 실제로 쓴 토큰량과 반복을 반영한다. |
| 파레토 전선 | 성능을 높이거나 비용을 낮추려면 다른 한쪽을 포기해야 하는 최적 경계 | 브랜드보다 성능·비용 조합이 우수한 후보를 찾는 데 유용하다. |
| 추론 강도 | 모델이 답변 전에 사용하는 계산과 사고량의 설정 | 높이면 성능이 좋아질 수 있지만 비용과 지연도 함께 늘어난다. |
References
- [1] Artificial Analysis | Opus 5: Fable 5 level intelligence at a lower cost per task
- [2] Artificial Analysis | GPT-5.6 benchmarks across Intelligence, Speed and Cost
- [3] Artificial Analysis | Kimi K3 achieves #3 in the Intelligence Index
- [4] Artificial Analysis | GLM-5.2 and the open-weights Pareto frontier
- [5] Artificial Analysis | DeepSeek model intelligence, performance and cost
- [6] Artificial Analysis | MiniMax-M3 intelligence, performance and price
- [7] Artificial Analysis | Qwen3.7 Plus provider performance and cost
- [8] Artificial Analysis | Gemini 3.6 Flash and Gemini 3.5 Flash-Lite
- [9] Artificial Analysis | Grok 4.5 intelligence and cost
- [10] Artificial Analysis | Intelligence Benchmarking Methodology v4.1


댓글
댓글 쓰기