← Back to list

LMArena 상위권에서 보이는 선호 경쟁의 현재 모습

LLMLMArenaAI모델투자관점

인간 선호가 만드는 LLM 리더보드, 이번 주 상위권은 더 촘촘해졌습니다

이번 글은 2026년 7월 2일 기준 LMArena(Chatbot Arena) 인간 선호 투표 기반 ELO 순위 Top 20 자료로 씁니다. 직전 스냅샷 기준일은 2026년 6월 16일입니다. 따라서 여기서 말하는 "직전 대비"는 2026년 6월 16일에서 2026년 7월 2일 사이의 변화입니다.

전제부터 짚겠습니다. 이 글은 제공된 리더보드 자료에만 근거합니다. 자료에 없는 벤치마크 점수, 실제 제품 매출, API 사용량, 기업별 고객 수, 모델별 비용 구조는 쓰지 않습니다. 자료에는 LMArena 리더보드의 실제 URL이 포함되어 있지 않기 때문에, 링크도 새로 만들어 넣지 않습니다. 공개 자료 기준으로는 출처가 LMArena(Chatbot Arena) 인간 선호 투표 기반 ELO 순위라는 점까지만 확인할 수 있습니다.

ELO는 원래 체스 같은 경쟁 게임에서 많이 쓰이는 점수 체계입니다. LMArena에서는 사람들이 두 모델의 답변을 나란히 보고 어느 쪽이 더 낫다고 느끼는지 선택합니다. 이런 선택이 많이 쌓이면, 자주 선택되는 모델의 ELO가 올라갑니다. 쉽게 말해 ELO는 "사람들이 직접 비교했을 때 더 선호한 정도가 누적된 점수"에 가깝습니다. 절대적인 지능 점수라기보다는, 특정한 사용자 비교 환경에서 나타난 선호도 신호로 보는 편이 조심스럽습니다.

이번 Top 20에서 가장 큰 특징은 상위권 격차가 촘촘하다는 점입니다. 1위 claude-opus-4-6-thinking의 ELO는 1552이고, 3위 gpt-5.5는 1544입니다. 1위와 3위 사이가 8점 차이에 불과합니다. 5위 qwen3.5-max-preview는 ELO 1536, 6위 claude-opus-4-7-thinking은 1535, 7위 claude-opus-4-7은 1532입니다. 8위부터 11위까지는 kimi-k2.6, gpt-5.5-high, gemini-3-pro, gemini-3.5-flash가 모두 ELO 1529로 나란히 서 있습니다.

이 숫자만 놓고 보면 "한 모델이 압도적으로 앞서간다"고 말하기보다는, 최상위권에서 여러 제공사와 여러 모델 라인이 좁은 간격으로 경쟁한다고 보는 편이 맞습니다. 투자자 입장에서는 이 구도가 중요합니다. 사용자가 체감하는 품질 경쟁에서 선두권이 좁아질수록, 단순 모델 성능만으로 장기간 차별화하기가 어려워질 수 있기 때문입니다. 결국 배포 채널, 가격, 지연시간, 제품 내 통합, 기업 고객의 보안 요구, 개발자 생태계 같은 주변 요소가 더 중요해질 가능성이 높습니다.

2026-07-02 LMArena Top 20의 큰 흐름Anthropic1, 2위 포함 6개촘촘한 중상위권1529 전후 다수변화 신호상승, 하락, 신규인간 선호 ELO는 제품 체감 품질의 한 신호이지만, 사업 경쟁력 전체를 뜻하지는 않습니다
LMArena Top 20은 최상위권 장악, 중상위권 밀집, 신규 진입 신호를 함께 봐야 합니다.

Anthropic은 최상위권에서 가장 강하게 보입니다

이번 Top 20에서 가장 먼저 보이는 이름은 Anthropic입니다. 1위는 claude-opus-4-6-thinking, ELO 1552입니다. 직전 대비 1계단 상승했습니다. 2위는 claude-opus-4-6, ELO 1548입니다. 직전 대비 1계단 하락했습니다. 같은 제공사의 두 모델이 1위와 2위를 차지했고, 두 모델의 위치가 서로 바뀌었습니다.

여기서 "thinking"이 붙은 모델이 1위로 올라섰다는 점은 눈여겨볼 만합니다. 자료만으로 내부 추론 방식이나 실제 기능 차이를 단정할 수는 없습니다. 다만 공개된 순위 변화만 놓고 보면, 사용자 비교 환경에서 claude-opus-4-6-thinking이 claude-opus-4-6보다 조금 더 선호된 것으로 보입니다. 투자자 관점에서는 모델명에 붙은 변형이 단순한 마케팅 라벨에 그치지 않고 사용자 선호 차이로 이어지는지 살펴보게 됩니다.

Anthropic은 이외에도 4위 claude-fable-5(ELO 1495), 6위 claude-opus-4-7-thinking(ELO 1535), 7위 claude-opus-4-7(ELO 1532), 19위 claude-opus-4-8(ELO 1512)을 Top 20에 올렸습니다. 특히 claude-opus-4-8은 이번 Top 20 신규 진입 모델입니다. 신규 진입 자체가 "더 좋아졌다"는 결론을 보장하지는 않지만, 적어도 상위 20위 안에서 새 Anthropic 모델 라인이 관찰되기 시작했다는 의미는 있습니다.

흥미로운 대목은 Anthropic 모델들이 최상단과 중상단에 넓게 분포한다는 것입니다. 1위와 2위는 확실한 최상위권이고, 6위와 7위도 바로 뒤를 받칩니다. 19위 신규 진입 모델은 하단권이지만, Top 20 안에 들어왔다는 점에서 모델 포트폴리오가 계속 갱신되고 있음을 보여줍니다. 공개된 자료 기준으로는 Anthropic이 이번 스냅샷에서 가장 강한 상위권 존재감을 보인다고 말할 수 있습니다.

OpenAI는 3위권과 중하위권에 안정적으로 남아 있습니다

OpenAI는 3위 gpt-5.5(ELO 1544), 9위 gpt-5.5-high(ELO 1529), 14위 gpt-5.4-high(ELO 1519), 17위 gpt-5.4(ELO 1514)를 Top 20에 올렸습니다. 3위 gpt-5.5는 직전 대비 변화가 없습니다. 9위 gpt-5.5-high도 변화가 없습니다. 14위 gpt-5.4-high도 변화가 없습니다. 17위 gpt-5.4는 직전 대비 2계단 상승했습니다.

이 흐름은 두 가지로 읽힙니다. 우선 OpenAI의 대표 모델은 최상위권에 여전히 남아 있습니다. gpt-5.5는 3위이고, ELO 1544로 1위와 8점 차이입니다. 또 OpenAI 모델들은 이번 스냅샷에서 폭발적인 순위 변동보다는 비교적 안정적인 위치 유지에 가깝습니다. gpt-5.4가 2계단 오른 점은 긍정적이지만, 가장 앞단에서는 Anthropic의 1, 2위 구도가 더 두드러집니다.

투자자 관점에서 안정성은 양면적입니다. 상위권을 계속 지킨다는 것은 강력한 신호입니다. 반대로 경쟁사 모델이 1위와 2위를 가져가고, 다른 제공사 모델들이 1529 전후로 몰려 있다면, "상위 모델을 보유했다"는 사실만으로 충분한 방어력이 생기는지는 계속 확인해야 합니다. 특히 기업용 AI 시장에서는 모델 자체의 순위뿐 아니라, 실제 워크플로우에 얼마나 깊이 들어가는지, 고객이 얼마나 전환 비용을 느끼는지가 중요해질 가능성이 높습니다.

Google은 Flash 라인의 상승이 눈에 띕니다

Google은 10위 gemini-3-pro(ELO 1529), 11위 gemini-3.5-flash(ELO 1529), 13위 gemini-3.1-pro-preview(ELO 1527), 16위 gemini-3-flash(ELO 1514)를 Top 20에 올렸습니다. 이 중 가장 의미 있는 변화는 gemini-3.5-flash입니다. 직전 대비 4계단 상승해 11위에 올라왔습니다.

Flash라는 이름에서 일반적으로 빠른 응답이나 경량 모델을 떠올릴 수 있지만, 이 자료만으로 모델의 비용, 속도, 구조를 단정해서는 안 됩니다. 다만 gemini-3.5-flash가 ELO 1529로 8위부터 10위까지의 모델들과 같은 점수대에 있다는 점은 눈여겨볼 만합니다. 사용자가 비교해 선택하는 환경에서 Flash 계열 모델이 중상위권 선호를 얻고 있다는 뜻으로 읽힙니다.

gemini-3-flash도 16위로 직전 대비 1계단 상승했습니다. 반면 gemini-3.1-pro-preview는 13위로 직전 대비 2계단 하락했습니다. Google 내부에서도 모델 라인별로 선호 신호가 엇갈리는 모습입니다. 자료 기준으로는 Pro 계열이 무너졌다고 말할 수는 없지만, 이번 스냅샷에서는 Flash 계열의 상승이 더 선명합니다.

투자자 입장에서는 이 지점이 중요합니다. 사용자가 실제로 원하는 것은 언제나 가장 크고 복잡한 모델만은 아닐 수 있습니다. 충분히 좋은 답변을 빠르고 안정적으로 주는 모델이 제품 안에서는 더 큰 가치를 만들 수 있습니다. LMArena ELO만으로 비용 효율성을 판단할 수는 없지만, gemini-3.5-flash의 4계단 상승은 "상위권 품질 체감"과 "제품 배포 가능성"을 함께 생각하게 만드는 신호입니다.

Alibaba, Z.ai, Moonshot도 Top 20 안에서 존재감을 유지합니다

Alibaba는 5위 qwen3.5-max-preview(ELO 1536), 12위 qwen3.7-max-preview(ELO 1528)를 올렸습니다. 둘 다 직전 대비 순위 변화는 없습니다. 특히 qwen3.5-max-preview는 5위로, Anthropic과 OpenAI 바로 뒤의 강한 위치에 있습니다. qwen3.7-max-preview도 12위로 중상위권입니다.

Moonshot의 kimi-k2.6은 8위, ELO 1529입니다. 직전 대비 1계단 하락했지만, 여전히 1529 점수대에 있습니다. 이 점수대에는 gpt-5.5-high, gemini-3-pro, gemini-3.5-flash도 함께 있습니다. 따라서 1계단 하락만으로 약세를 크게 단정하기보다는, 중상위권 경쟁이 상당히 촘촘하다고 보는 편이 조심스럽습니다.

Z.ai는 15위 glm-5(ELO 1517), 18위 glm-5.1(ELO 1513), 20위 glm-5.2 (max)(ELO 1509)를 Top 20에 올렸습니다. 다만 세 모델 모두 하락했습니다. glm-5는 2계단 하락, glm-5.1도 2계단 하락, glm-5.2 (max)도 2계단 하락했습니다. Top 20 안에 여러 모델이 남아 있다는 점은 존재감이지만, 이번 직전 대비 변화만 보면 하단부에서 압력을 받고 있는 것으로 보입니다.

여기서도 단정은 피해야 합니다. LMArena의 인간 선호 기반 ELO는 한 가지 관찰 창입니다. 특정 지역, 특정 고객군, 특정 제품 내 성능과는 다를 수 있습니다. 하지만 공개 리더보드의 상위 20개 모델 안에서 Alibaba, Moonshot, Z.ai가 계속 등장한다는 사실은, 글로벌 LLM 경쟁이 미국 대형사만의 단순한 양강 구도로 설명되기 어렵다는 점을 드러냅니다.

직전 대비 가장 눈에 띄는 변화는 세 가지입니다

첫째, claude-opus-4-6-thinking이 1계단 상승해 1위가 됐습니다. 동시에 claude-opus-4-6은 1계단 하락해 2위가 됐습니다. 같은 Anthropic 모델군 안에서 thinking 버전과 일반 버전의 순위가 바뀐 셈입니다. 점수는 각각 1552와 1548입니다. 차이는 크지 않지만, 상징성은 있습니다. 인간 선호 비교에서 "추론형으로 보이는 변형"이 최상단에 섰기 때문입니다.

둘째, gemini-3.5-flash가 4계단 상승했습니다. 이번 Top 20에서 표시된 상승폭 중 가장 큽니다. ELO는 1529이고 순위는 11위입니다. 이 모델은 8위 kimi-k2.6, 9위 gpt-5.5-high, 10위 gemini-3-pro와 같은 ELO 점수대에 있습니다. 순위는 11위지만, 점수만 보면 중상위권 묶음 안에 들어와 있다고 봐야 합니다.

셋째, claude-opus-4-8이 신규 진입했습니다. 순위는 19위, ELO는 1512입니다. 신규 진입 모델이 곧바로 최상위권에 들어온 것은 아니지만, Anthropic이 이미 1위와 2위를 차지한 상태에서 또 하나의 Opus 계열 모델을 Top 20에 넣었다는 점은 모델 라인업 갱신 측면에서 의미가 있습니다.

하락 쪽에서는 gemini-3.1-pro-preview가 2계단 하락해 13위, glm-5가 2계단 하락해 15위, glm-5.1이 2계단 하락해 18위, glm-5.2 (max)가 2계단 하락해 20위가 됐습니다. kimi-k2.6도 1계단 하락해 8위입니다. 다만 이들 모델 상당수가 여전히 Top 20 안에 있으므로, 하락을 곧바로 경쟁력 상실로 해석하기는 어렵습니다. 특히 8위 kimi-k2.6처럼 ELO 1529 점수대에 있는 모델은 순위표상 하락했더라도 실제 점수 구간은 치열한 상위권입니다.

순위보다 더 중요한 것은 "점수대의 밀집"입니다

이번 자료를 볼 때 저는 순위 변화보다 ELO 점수대의 밀집을 더 중요하게 봅니다. 8위부터 11위까지 네 개 모델이 모두 ELO 1529입니다. 12위 qwen3.7-max-preview는 1528, 13위 gemini-3.1-pro-preview는 1527입니다. 이 구간에서는 1, 2점 차이로 순위가 갈립니다.

초심자에게 비유하면, 마라톤 결승선 근처에 여러 선수가 거의 동시에 들어오는 장면과 비슷합니다. 사진 판독으로 순위는 나뉘지만, 관중이 보기에는 거의 같은 무리입니다. LMArena Top 20의 중상위권도 비슷합니다. 순위 숫자는 다르지만, ELO가 붙어 있는 모델들은 사용자 선호 관점에서 매우 가까운 위치에 있을 수 있습니다.

따라서 투자자 관점에서는 "몇 위냐"와 함께 "어느 점수대에 몇 개 모델이 몰려 있느냐"를 함께 봐야 합니다. 한 회사의 모델이 단독으로 앞서가는 시장이라면 모델 그 자체가 강력한 방어벽이 될 수 있습니다. 반대로 여러 회사의 모델이 비슷한 선호 점수에 몰리면, 모델 호출을 감싸는 제품 경험, 데이터 연결, 업무 프로세스 통합, 신뢰성, 가격, 배포 속도가 더 큰 차이를 만들 수 있습니다.

이번 리더보드는 후자 쪽의 가능성을 보여주는 것 같습니다. 1위에서 3위까지는 Anthropic과 OpenAI가 가까운 격차로 경쟁합니다. 5위부터 13위까지는 Alibaba, Anthropic, Moonshot, OpenAI, Google이 섞여 있습니다. 14위부터 20위까지도 OpenAI, Z.ai, Google, Anthropic이 함께 있습니다. 특정 제공사가 상위권을 완전히 독점한다기보다는, Anthropic이 최상단에서 강하고 여러 제공사가 그 아래를 촘촘히 받치는 모양입니다.

투자자 관점에서는 모델 회사와 응용 회사의 질문이 달라집니다

모델 회사 관점에서 이번 자료가 던지는 질문은 비교적 분명합니다. 첫째, 인간 선호에서 상위권을 계속 유지할 수 있는가. 둘째, 단일 플래그십 모델뿐 아니라 여러 변형 모델을 Top 20 안에 넣을 수 있는가. 셋째, 신규 모델이 진입했을 때 기존 모델을 대체하는지, 아니면 포트폴리오를 넓히는지입니다.

Anthropic은 이번 스냅샷에서 이 질문들에 강한 신호를 보여줍니다. 1위와 2위를 동시에 차지했고, 6위와 7위에도 모델이 있으며, 19위에는 신규 진입 모델이 있습니다. OpenAI는 3위를 포함해 네 개 모델이 Top 20에 있고, Google은 Flash 계열 상승이 눈에 띕니다. Alibaba는 5위와 12위로 중상위권에 안정적으로 자리합니다. Z.ai는 여러 모델이 남아 있으나 직전 대비 하락이 이어졌습니다.

응용 회사 관점의 질문은 조금 다릅니다. "어느 모델 하나를 고르면 끝인가"보다는 "상위 모델들이 빠르게 바뀌고 촘촘해지는 환경에서 어떤 추상화 계층이 필요한가"가 중요합니다. 예를 들어 고객 지원, 리서치, 코드 작성, 문서 자동화 같은 제품은 특정 모델 하나의 순위에만 의존하면 리더보드 변화에 취약할 수 있습니다. 반대로 여러 모델을 비교하고, 작업별로 적합한 모델을 바꾸고, 사용자 피드백을 제품 안에서 축적할 수 있다면 상위 모델 경쟁을 오히려 활용할 수 있습니다.

이 점에서 LMArena의 인간 선호 ELO는 제품 전략의 출발점이 될 수는 있지만, 결론은 아닙니다. 어떤 모델이 일반 비교에서 선호된다고 해서 특정 기업 업무에서도 반드시 가장 좋은 것은 아닙니다. 법무 문서, 금융 리서치, 의료 상담, 코딩, 고객 응대는 각각 요구하는 정확성, 설명 방식, 실패 비용이 다릅니다. 투자자는 리더보드를 보되, 실제 사용 맥락에서의 반복 사용률과 전환 비용을 함께 봐야 합니다.

이번 주 관찰: 최상단은 Anthropic, 경쟁 구간은 다극화입니다

이번 2026년 7월 2일 LMArena Top 20을 한 문장으로 정리하면, 최상단에서는 Anthropic이 가장 강하게 보이고, 그 아래 중상위권에서는 OpenAI, Google, Alibaba, Moonshot, Z.ai가 촘촘히 경쟁하는 구도입니다.

직전 대비 가장 중요한 변화는 claude-opus-4-6-thinking의 1위 상승, gemini-3.5-flash의 4계단 상승, claude-opus-4-8의 Top 20 신규 진입입니다. 하락 쪽에서는 Z.ai의 glm 계열 세 모델이 각각 2계단씩 내려왔고, gemini-3.1-pro-preview도 2계단 하락했습니다. 다만 여러 하락 모델이 여전히 Top 20 안에 있다는 점에서, 단기 순위 변동만으로 승패를 단정하기는 어렵습니다.

제가 투자자로서 가장 눈여겨보는 부분은 "상위권의 품질이 점점 가까워지고 있다"는 신호입니다. 모델 자체의 성능 경쟁은 계속 중요하지만, ELO가 가까운 모델이 늘어날수록 제품화 역량의 중요성은 커질 가능성이 높습니다. 누가 더 좋은 모델을 만들었는가도 중요하지만, 누가 그 모델을 실제 업무와 소비자 경험 안에 더 자연스럽게 넣는가가 다음 질문이 됩니다.

그래서 이번 리더보드는 단순한 순위표라기보다, AI 산업의 경쟁 축이 어디로 이동하는지 보여주는 작은 창처럼 보입니다. 최상위 모델을 가진 회사는 계속 주목해야 합니다. 동시에 그 모델들을 빠르게 조합하고, 비용과 품질을 관리하며, 사용자의 반복 행동을 제품 안에 붙잡는 회사도 함께 살펴봐야 합니다.

YS-VC | Founder Intake Desk — Intervest