← Back to list

LLM 상위권이 다시 섞였습니다: LMArena Top 20의 이번 주 변화

LLMLMArena인공지능AI 투자

선두는 Anthropic, 가장 넓은 진영은 OpenAI입니다

2026년 7월 21일 기준 LMArena 리더보드의 1위는 Anthropic의 claude-opus-4-6-thinking입니다. ELO는 1512이며 직전 스냅샷인 7월 16일과 비교해 순위 변화가 없습니다.

그 뒤에는 OpenAI의 gpt-5.4가 신규 진입과 동시에 2위에 올랐고, Anthropic의 claude-opus-4-6가 한 계단 내려간 3위를 기록했습니다. 4위에는 또 다른 신규 모델인 OpenAI의 gpt-5.4-mini-high가 자리했습니다. 상위 5개 모델 가운데 Anthropic이 3개, OpenAI가 2개입니다.

범위를 Top 10으로 넓히면 두 회사의 대결 구도가 더 선명해집니다. Anthropic과 OpenAI가 각각 5개씩 차지합니다. Anthropic 모델은 1위, 3위, 5위, 7위, 9위에 고르게 놓였고, OpenAI 모델은 2위, 4위, 6위, 8위, 10위에 자리했습니다. Top 10 전체가 Anthropic과 OpenAI 모델입니다.

Top 20에서는 OpenAI가 10개로 절반을 차지합니다. Anthropic은 5개, Google은 4개, Meta는 1개입니다. 선두 모델은 Anthropic이 보유하고 있지만, 모델 수와 세대의 폭은 OpenAI가 가장 넓습니다.

순위 모델 제공사 ELO 직전 대비
1 claude-opus-4-6-thinking Anthropic 1512 변화 없음
2 gpt-5.4 OpenAI 1499 신규
3 claude-opus-4-6 Anthropic 1507 1계단 하락
4 gpt-5.4-mini-high OpenAI 1496 신규
5 claude-fable-5 Anthropic 1504 1계단 하락
6 gpt-5.4-high OpenAI 1494 11계단 상승
7 claude-opus-4-7-thinking Anthropic 1499 1계단 하락
8 gpt-5.2-high OpenAI 1493 신규
9 claude-opus-4-7 Anthropic 1492 1계단 하락
10 gpt-5.5 OpenAI 1490 7계단 하락
11 muse-spark-1.1 Meta 1491 7계단 상승
12 gpt-5.5-high OpenAI 1488 3계단 하락
13 gemini-3.6-flash Google 1491 신규
14 gpt-5.2 OpenAI 1486 신규
15 gemini-3.5-flash-high Google 1490 신규
16 gpt-5.6-sol-xhigh OpenAI 1486 변화 없음
17 gemini-3-pro Google 1490 6계단 하락
18 gpt-5.1 OpenAI 1485 신규
19 gemini-3.1-pro-preview Google 1489 7계단 하락
20 gpt-5.3-chat-latest OpenAI 1484 신규

자료에 적힌 공식 순위와 ELO의 숫자 순서는 일부 구간에서 일치하지 않습니다. 예를 들어 3위 claude-opus-4-6의 ELO 1507은 2위 gpt-5.4의 1499보다 높습니다. 5위 claude-fable-5의 ELO 1504도 4위 gpt-5.4-mini-high의 1496보다 높습니다. 공개된 자료만으로는 이런 차이가 생긴 이유를 확인할 수 없습니다. 이 글에서는 제공된 공식 순위를 따르고 ELO 숫자만으로 순서를 다시 만들지 않았습니다.

ELO는 모델끼리 치른 ‘답변 선호 대결’의 누적 기록입니다

LMArena의 ELO는 시험 문제의 정답률처럼 미리 정해진 채점표로 계산하는 점수가 아닙니다. 사람들이 두 모델의 답변을 나란히 보고 어느 쪽을 더 선호하는지 선택한 결과를 누적한 점수입니다.

두 요리사가 같은 주문을 받고 음식을 만든 뒤, 손님이 더 마음에 드는 한 접시를 고르는 방식과 비슷합니다. 이런 선택이 여러 차례 쌓이면 상대적으로 더 자주 선택된 모델의 위치가 올라갑니다. ELO는 절대적인 지능 점수라기보다 특정 시점에 사용자들이 실제 답변을 비교해 선택한 상대적 선호의 기록으로 이해하는 편이 적절합니다.

모델 A 답변모델 B 답변사람이 더 나은답변을 선택선택 결과 누적ELO와 순위한 번의 평가보다 여러 사람의 비교 선택이 쌓여 만들어지는 상대적 지표
LMArena ELO는 두 모델의 답변을 비교한 사람들의 선택이 누적되어 만들어지는 상대적 선호 지표입니다.

이런 특성 때문에 순위 한 칸의 움직임을 곧바로 기술력의 확정적 우열로 해석하기는 어렵습니다. 이번 자료에는 투표 수, 점수의 오차 범위, 평가 질문의 구성, 모델별 비용과 응답 속도가 포함되어 있지 않습니다. 어디까지나 인간 선호 투표에서 나타난 현재 위치와 변화 방향을 읽어야 합니다.

가장 큰 변화는 신규 진입 8개와 두 모델의 급상승입니다

이번 Top 20에는 신규 진입 모델이 8개입니다. 전체 20개 가운데 40%가 새로 들어왔습니다. OpenAI 모델이 6개, Google 모델이 2개입니다.

OpenAI에서는 gpt-5.4가 2위, gpt-5.4-mini-high가 4위로 바로 상위권에 진입했습니다. 이어 gpt-5.2-high가 8위, gpt-5.2가 14위, gpt-5.1이 18위, gpt-5.3-chat-latest가 20위에 새로 이름을 올렸습니다. Google에서는 gemini-3.6-flash가 13위, gemini-3.5-flash-high가 15위에 신규 진입했습니다.

다만 ‘신규 진입’은 이 모델들이 이번 기간에 처음 공개됐다는 뜻이 아닙니다. 제공된 자료에서 확인되는 것은 직전 스냅샷의 Top 20에는 없었지만 이번 Top 20에는 들어왔다는 사실뿐입니다. 직전 Top 20의 전체 명단도 제공되지 않아 어떤 기존 모델들이 밀려났는지는 확인할 수 없습니다.

기존 모델 가운데 가장 크게 상승한 것은 OpenAI의 gpt-5.4-high입니다. 11계단 올라 6위에 자리했습니다. 신규 진입이 아닌 모델이 단기간에 Top 10 안으로 크게 이동해 이번 변화 중 가장 눈에 띕니다.

Meta의 muse-spark-1.1도 7계단 상승해 11위에 올랐습니다. Top 20에서 Meta의 모델은 하나뿐이지만, 이번 스냅샷에서는 분명한 상승세를 보였습니다.

OpenAI의 gpt-5.5는 7계단 내려가 10위를 기록했습니다. gpt-5.5-high도 3계단 하락한 12위입니다. 한편 gpt-5.4는 2위에 신규 진입했고 gpt-5.4-high는 6위까지 상승했습니다. 적어도 이번 자료에서는 모델 이름에 붙은 세대 숫자가 높다고 해서 인간 선호 순위도 일관되게 높아지지는 않았습니다.

Google에서는 기존 Pro 계열의 하락과 Flash 계열의 신규 진입이 동시에 나타났습니다. gemini-3-pro는 6계단 내려간 17위, gemini-3.1-pro-preview는 7계단 내려간 19위입니다. gemini-3.6-flash와 gemini-3.5-flash-high는 각각 13위와 15위에 새로 들어왔습니다. 자료에는 모델별 속도, 가격, 기능이나 이용 조건이 없어 이 교체가 어떤 제품 특성 때문인지는 판단할 수 없습니다.

Anthropic은 선두를 유지했지만 나머지 4개 모델이 모두 한 계단씩 내려갔습니다. claude-opus-4-6은 3위, claude-fable-5는 5위, claude-opus-4-7-thinking은 7위, claude-opus-4-7은 9위입니다. Anthropic 모델에 대한 선호가 갑자기 약해졌다기보다 gpt-5.4와 gpt-5.4-mini-high 같은 신규 모델이 상위에 진입하면서 기존 순위가 한 칸씩 밀린 결과일 가능성도 있습니다.

점수는 촘촘하지만, 그 차이의 의미까지 단정할 수는 없습니다

이번 Top 20의 ELO는 1위의 1512부터 20위의 1484까지 분포합니다. 표시된 최고점과 최저점의 차이는 28점입니다. 상위권에 여러 모델이 비교적 좁은 점수 범위로 모여 있습니다.

그러나 이 28점이 통계적으로 얼마나 의미 있는 차이인지, 실제 제품 선택에서 얼마나 큰 품질 차이로 체감되는지는 이 자료만으로 알 수 없습니다. 순위와 표시 ELO가 완전히 같은 순서로 배열되지 않은 점까지 고려하면 한두 점의 차이를 정밀한 성능 격차처럼 읽는 것은 특히 조심해야 합니다.

제가 이 표에서 더 눈여겨보는 것은 개별 점수의 작은 차이보다 상위권의 구성과 이동 폭입니다. Anthropic은 1위를 포함해 Top 9 안에 5개 모델을 유지하고 있습니다. OpenAI는 Top 20의 절반을 차지하면서 신규 진입과 큰 폭의 상승을 동시에 기록했습니다. Google은 기존 Pro 계열이 내려가는 동안 두 Flash 계열이 새로 진입했고, Meta는 하나의 모델이지만 7계단 상승했습니다.

선두 한 자리만 보면 Anthropic이 앞섭니다. 이번 주의 변화량과 모델 포트폴리오의 폭은 OpenAI 쪽에서 더 크게 나타났습니다.

투자자는 ‘우승 모델’보다 경쟁의 갱신 속도를 봐야 합니다

투자자의 시각에서 먼저 볼 대목은 Top 20의 40%가 직전 스냅샷 대비 신규 진입 모델로 채워졌다는 사실입니다. 불과 두 기준일 사이에 상위권 구성이 크게 달라졌습니다. 인간 선호 기반 모델 경쟁에서는 현재 순위가 빠르게 바뀔 수 있다는 의미입니다.

한 회사 안에서도 모델별 위치가 크게 다릅니다. OpenAI는 gpt-5.4를 2위에 새로 올리고 gpt-5.4-high를 11계단 끌어올렸지만, gpt-5.5는 7계단 하락했습니다. Google 역시 신규 Flash 계열과 하락한 Pro 계열이 함께 존재합니다. 제공사 이름이나 세대 번호만으로 사용자 선호를 한 방향으로 설명하기 어렵습니다.

모델 자체를 기반으로 사업을 만드는 회사라면 특정 모델의 현재 1위 여부만큼 모델을 교체할 수 있는 구조와 여러 제공사를 활용할 수 있는 유연성도 중요할 가능성이 높습니다. 다만 이것은 이번 리더보드의 빠른 변동에서 도출한 투자 관점의 해석입니다. 실제 전환 비용이나 기술 구조는 이 자료에 포함되어 있지 않습니다.

이 리더보드는 비용과 사업성을 직접 보여주지 않습니다. 인간이 선호한 답변을 만드는 능력은 제품 경쟁력의 중요한 일부일 수 있지만, 실제 도입에서는 가격, 응답 속도, 안정성, 보안, 배포 방식, 도구 연동 같은 요소도 함께 고려될 수 있습니다. 이번 자료에는 이런 정보가 없으므로 ELO 순위를 매출, 수익성 또는 기업가치의 순위로 바꾸어 읽어서는 안 됩니다.

제가 이번 주 표에서 얻는 결론은 단순합니다. Anthropic은 선두와 상위권 밀도를 지켰고, OpenAI는 가장 많은 모델과 가장 큰 상승 폭으로 판을 흔들었습니다. Google은 신규 진입과 기존 모델 하락이 교차했고, Meta는 muse-spark-1.1의 상승으로 존재감을 보였습니다.

신규 진입 8개와 큰 순위 변동을 보면 지금의 리더보드는 고정된 서열표가 아닙니다. 투자자는 한 주의 1위를 맞히기보다 모델 교체가 빨라져도 고객 가치와 사업의 지속성을 지킬 수 있는 회사인지 살펴봐야 합니다.

YS-VC | Founder Intake Desk — Intervest