← Back to list

LMArena 상위권을 채운 Anthropic과 여섯 신규 모델

LMArenaLLM인공지능모델 리더보드AI 투자

1위부터 8위까지 다섯 자리를 차지한 Anthropic

2026년 7월 16일 기준 LMArena(Chatbot Arena) 인간 선호 리더보드에서 가장 먼저 눈에 들어오는 것은 Anthropic의 상위권 집중도입니다.

1위 claude-opus-4-6-thinking의 ELO는 1,551점입니다. claude-opus-4-6이 1,548점으로 2위, OpenAI의 gpt-5.5가 1,543점으로 3위에 자리했습니다. Anthropic은 여기에 claude-fable-5 4위, claude-opus-4-7-thinking 6위, claude-opus-4-7 8위를 더했습니다.

상위 8개 자리 가운데 Anthropic 모델이 다섯 개입니다. 사고 과정을 강화한 것으로 보이는 thinking 변형과 일반 변형이 나란히 상위권에 올랐습니다. 공개된 자료만으로 두 변형의 구체적인 기술 차이나 비용 구조를 알 수는 없습니다. 다만 사용자들이 답변을 직접 비교한 환경에서 같은 모델 계열의 여러 변형이 고르게 선택받은 사실은 확인할 수 있습니다.

Anthropic 뒤에서는 OpenAI의 gpt-5.5가 3위를 지키고 있습니다. Alibaba의 qwen3.5-max-preview는 1,537점으로 5위, Google의 신규 모델 gemini-3.5-flash-medium은 1,533점으로 7위에 진입했습니다. 8위 claude-opus-4-7과 표시된 ELO가 1,533점으로 같습니다.

ELO는 시험 문제 몇 개를 풀어 받은 점수라기보다, 사람들이 두 모델의 답변을 나란히 보고 더 나은 쪽을 선택한 결과를 누적한 점수입니다. 동네 바둑 모임에서 여러 사람이 계속 대국하고, 강한 상대를 이길수록 평점이 달라지는 방식과 비슷합니다. 이 순위는 사람들이 실제 비교 상황에서 어떤 답변을 선호했는지를 보여주지만, 모델의 모든 능력을 하나의 절대 점수로 확정하는 표는 아닙니다.

상위 20개 자리를 제공사별로 펼쳐 보면

이번 Top 20에는 Anthropic 5개, OpenAI 4개, Google 3개, Alibaba·Moonshot·Meta가 각각 2개, ZAI와 Baidu가 각각 1개 모델을 올렸습니다.

LMArena Top 20 제공사별 모델 수Anthropic5OpenAI4Google3Alibaba2Moonshot2Meta2ZAI·Baidu각 1
2026년 7월 16일 Top 20에 포함된 모델을 제공사별로 집계했습니다.

모델 수만 보면 Anthropic이 앞서지만, 이 숫자를 곧바로 시장점유율로 읽어서는 안 됩니다. 한 제공사의 유사 계열 모델이나 설정이 여러 자리를 차지할 수 있고, 리더보드 선호도가 실제 사용량이나 매출을 뜻하지도 않기 때문입니다.

상위권이 한 회사만의 무대인 것도 아닙니다. 5위에는 Alibaba, 7위에는 Google, 10위에는 Moonshot이 자리합니다. 20위까지 넓히면 Meta, ZAI, Baidu도 등장합니다. 최상단은 Anthropic이 두껍게 차지했지만, 경쟁에 참여한 공급자층은 상당히 넓습니다.

직전 대비 가장 큰 사건은 여섯 모델의 신규 진입

직전 스냅샷인 2026년 7월 2일과 비교하면, 이번 Top 20에는 여섯 모델이 새로 들어왔습니다.

  • 7위 gemini-3.5-flash-medium 1,533점, Google
  • 13위 kimi-k3 1,473점, Moonshot
  • 15위 muse-spark 1,473점, Meta
  • 16위 gpt-5.6-sol-xhigh 1,525점, OpenAI
  • 18위 muse-spark-1.1 1,518점, Meta
  • 20위 ernie-5.1 1,468점, Baidu

가장 두드러진 신규 진입은 Google의 gemini-3.5-flash-medium입니다. 곧바로 7위에 들어왔고, 표시된 점수는 8위 Anthropic 모델과 같습니다. 이름에 포함된 flashmedium이 구체적으로 어떤 성능·속도·비용 조합을 뜻하는지는 이 자료만으로 판단할 수 없습니다. 이름만 보고 제품 전략을 단정하기보다는, 신규 진입과 동시에 인간 선호 기준 최상위권에 포착됐다는 사실까지만 읽는 편이 안전합니다.

Meta는 muse-sparkmuse-spark-1.1 두 모델을 한꺼번에 Top 20에 올렸습니다. Moonshot은 기존 kimi-k2.6에 이어 신규 kimi-k3를 추가했고, OpenAI의 gpt-5.6-sol-xhigh도 새로 진입했습니다. Baidu의 ernie-5.1은 20위로 Top 20에 들어왔습니다.

여섯 개 신규 모델은 Top 20의 30%입니다. 이번 스냅샷의 구성이 직전보다 상당히 많이 바뀐 셈입니다. 그렇다고 신규 진입이 모두 모델 자체의 급격한 성능 향상에서 비롯됐다고 단정할 수는 없습니다. 공개된 자료에는 투표 수, 리더보드 편입 시점, 평가 기간, 표본 구성과 같은 배경 정보가 없기 때문입니다.

기존 모델의 순위 변동은 대체로 하향 쪽에 몰렸습니다

신규 진입을 제외한 기존 모델 가운데 순위가 오른 것으로 표시된 모델은 Google의 gemini-3.1-pro-preview입니다. 1계단 상승해 12위가 됐고 ELO는 1,528점입니다.

하락한 모델은 더 많습니다.

  • OpenAI gpt-5.4-high: 3계단 하락해 17위
  • Moonshot kimi-k2.6: 2계단 하락해 10위
  • Alibaba qwen3.7-max-preview: 2계단 하락해 14위
  • Anthropic claude-opus-4-7: 1계단 하락해 8위
  • Google gemini-3-pro: 1계단 하락해 11위
  • ZAI glm-5.1: 1계단 하락해 19위

가장 큰 하락은 gpt-5.4-high의 3계단입니다. 이를 곧바로 모델 품질이 나빠졌다는 뜻으로 해석하기는 어렵습니다. 이번에만 여섯 모델이 신규 진입했기 때문에 기존 모델의 점수가 유지되더라도 새 모델이 위쪽에 들어오면 순위는 밀릴 수 있습니다.

상위 6개 모델은 직전 대비 표시가 모두 -로 제시돼 있습니다. 최상단의 순서는 유지됐고, 7위 이하에서는 신규 모델이 들어오며 중위권과 하위권의 자리가 재편된 모습에 가깝습니다.

원자료의 순위와 점수가 맞지 않는 구간은 주의해야 합니다

이번 자료에는 해석에 앞서 짚어야 할 데이터 정합성 문제가 있습니다.

13위 kimi-k3와 15위 muse-spark의 ELO는 각각 1,473점으로 적혀 있습니다. 그런데 그 아래 순위인 14위 qwen3.7-max-preview는 1,526점, 16위 gpt-5.6-sol-xhigh는 1,525점, 17위부터 19위까지는 각각 1,518점입니다. 점수만 내림차순으로 정렬했다면 이 순서는 성립하기 어렵습니다. 20위 ernie-5.1의 1,468점도 같은 맥락에서 확인해야 합니다.

순위와 점수가 서로 다른 필터나 집계 기준에서 왔을 수도 있고, 전사 과정에서 일부 숫자가 잘못 대응됐을 수도 있습니다. 제공된 자료만으로는 원인을 확정할 수 없습니다. 그래서 숫자나 순위를 임의로 고치지 않고 원문 그대로 인용했습니다.

제공된 원문에는 리더보드의 실제 URL 문자열도 없습니다. 링크를 새로 만들어서는 안 된다는 근거 원칙에 따라 LMArena(Chatbot Arena) 리더보드 링크를 임의로 생성하지 않았습니다. 순위와 ELO 사이의 불일치는 원본 페이지 주소가 확보되면 가장 먼저 재확인해야 할 항목입니다.

투자자가 읽어야 할 것은 한 번의 순위보다 경쟁의 속도입니다

이번 스냅샷에서 제가 먼저 보는 지점은 세 가지입니다.

Anthropic은 인간 선호 기준 최상위 구간에 모델이 밀집해 있습니다. 1위와 2위를 모두 차지했고, 상위 8개 중 다섯 개 모델이 Anthropic 계열입니다. 적어도 이번 리더보드에서는 단일 대표 모델만 우연히 앞섰다기보다 여러 변형이 함께 상위권을 형성한 모습에 가깝습니다.

Google의 신규 진입으로 상위권 경쟁은 더 촘촘해졌습니다. gemini-3.5-flash-medium이 7위로 들어왔고, 기존 gemini-3-progemini-3.1-pro-preview도 각각 11위와 12위에 있습니다. Google은 이번 Top 20에 세 모델을 올렸습니다.

모델 경쟁의 교체 주기도 빠릅니다. 불과 두 스냅샷 사이에 여섯 모델이 Top 20에 새로 진입했습니다. 기존 강자가 상위권을 유지하더라도 중위권 아래에서는 새 모델이 기존 모델의 자리를 빠르게 밀어낼 수 있습니다.

투자자에게는 특정 모델의 일시적인 1계단 변동보다 이런 흐름이 더 중요할 수 있습니다. 모델을 활용하는 기업이 어느 한 공급자의 현재 순위만 믿고 제품 구조를 고정하면, 짧은 기간 안에 더 선호되는 대안이 등장했을 때 대응하기 어렵습니다. 반대로 여러 모델을 교체하거나 비교할 수 있는 구조, 실제 고객 업무에 맞춰 모델을 선택하는 체계, 공급자가 바뀌어도 서비스 품질을 유지하는 운영 역량은 더 중요해질 가능성이 높다고 봅니다.

이 자료만으로 모델의 가격, 응답 속도, 안정성, 보안, 기업 도입 실적이나 수익성을 판단할 수는 없습니다. 사람들의 답변 선호에서 앞서는 것과 사업적으로 좋은 제품이 되는 것은 서로 연결될 수 있지만 같은 개념은 아닙니다. LMArena 순위는 제품 경쟁력을 살펴보는 하나의 창이지, 투자 판단 전체를 대신하는 성적표는 아닙니다.

이번 주에는 최상위권에서 Anthropic의 강세가 이어졌고, Google의 신규 모델이 7위로 진입했습니다. Top 20 전체에는 여섯 신규 모델이 등장하면서 경쟁 구성이 크게 바뀌었습니다. 일부 순위와 ELO가 서로 맞지 않는다는 한계도 확인됩니다. 다음 스냅샷에서는 상위 6개의 안정성이 계속되는지, 이번 신규 진입 모델들이 자리를 유지하는지, 현재의 점수 불일치가 원자료에서 어떻게 정리되는지를 함께 살펴보겠습니다.

YS-VC | Founder Intake Desk — Intervest