← Back to list

14에서 42로, Solar Pro 4는 업무형 모델로 건너갔습니다

업스테이지Solar Pro 4Artificial AnalysisArenaAI에이전트

업스테이지의 Solar Pro 4가 Artificial Analysis Intelligence Index에서 42점을 기록했습니다. 같은 사이트에서 현재 14점으로 평가되는 Solar Pro 3보다 표시 점수가 정확히 세 배 높습니다. 2026년 3월 공개된 전작에서 불과 넉 달여 만에 만든 큰 폭의 상승입니다.

다만 14 → 42를 곧바로 "지능이 세 배가 됐다"고 해석해서는 안 됩니다. Artificial Analysis의 지수는 비율 척도가 아니며, 현재 버전은 에이전트 업무에 34%의 가장 높은 가중치를 둡니다. Solar Pro 4의 진짜 의미는 막연한 지능의 세 배가 아니라 정답을 생성하는 모델에서 긴 업무를 수행하는 모델로 평가 축을 옮겼고, 그 축에서 실제 외부 점수를 만들었다는 것입니다.

이번 공개와 함께 Solar Pro 4는 Arena의 최신 텍스트 리더보드에 정식 등재됐습니다. 별도의 Arena 에이전트 평가에서는 44위를 기록해 43위 MiniMax M2.7, 45위 NVIDIA Nemotron 3 Ultra와 통계적으로 겹치는 구간에 들어왔습니다. 세 숫자는 모두 의미가 있지만 서로 다른 것을 측정합니다. 이를 섞지 않고 읽어야 Solar Pro 4의 현재 위치가 보입니다.

점수는 세 배, 모델의 변화는 그보다 구체적입니다

Artificial Analysis의 현재 측정값을 같은 기준으로 비교하면 변화의 방향이 선명합니다.

Solar Pro 4는 업무형 평가와 문맥 길이를 크게 높였습니다Artificial Analysis 현재 측정값 · 가격은 공식 API 표준 요금Solar Pro 3Solar Pro 4Intelligence Index1442Agentic Index2.933.6문맥 길이128K512K · 4배생성 속도123.9 token/s59.4 token/s · 52% 낮음입력 / 출력 100만 토큰$0.15 / $0.60$0.30 / $1.20 · 2배높은 업무 성공률과 긴 문맥을 얻는 대신 처리 속도와 토큰당 비용에서는 대가를 치렀습니다.
표시 점수의 비율은 3배지만 Intelligence Index는 비율 척도가 아닙니다. 속도는 Artificial Analysis 실측, 가격은 업스테이지 표준 요금입니다.

종합 지수보다 세부 평가가 더 중요합니다. Solar Pro 3와 Pro 4의 현재 Artificial Analysis 결과를 비교하면 다음과 같습니다.

평가 Solar Pro 3 Solar Pro 4 무엇을 보는가
Agentic Index 2.9 33.6 업무·도구 사용 종합
GDPval-AA v2 Elo 498 1,276 44개 직업의 지식 업무
Terminal-Bench v2.1 12.0% 57.3% 터미널 기반 장기 작업
τ³ Banking 8.7% 23.3% 상태가 변하는 고객 업무
AA-LCR 31.0% 70.7% 긴 문맥 추론
SciCode 24.7% 43.6% 과학 연구 코드 작성
Humanity's Last Exam 10.3% 29.2% 고난도 전문 지식·추론
GPQA Diamond 72.4% 89.1% 대학원 수준 과학 질의
AA-Omniscience -53.4 -0.9 지식과 환각 억제의 균형

가장 큰 변화는 에이전트 영역입니다. Agentic Index의 숫자는 2.9에서 33.6으로 약 11.6배 높아졌습니다. Terminal-Bench는 약 4.8배, 장문 추론은 약 2.3배 상승했습니다. 반면 GPQA는 72.4%에서 89.1%로 개선됐지만 에이전트 점수만큼 극적으로 변하지 않았습니다. 이미 아는 내용을 답하는 능력보다 환경 안에서 여러 단계를 끝까지 수행하는 능력이 더 크게 강화됐다는 뜻입니다.

환각 지표도 흥미롭습니다. AA-Omniscience에서 정답률은 18.5%에서 18.9%로 거의 같았지만 환각률은 88.2%에서 24.4%로 낮아졌습니다. 점수가 -53.4에서 -0.9로 오른 주된 배경은 더 많은 답을 맞힌 것보다 모르는 문제에서 틀린 답을 단정하지 않게 된 데 있습니다. 업스테이지가 공식 발표에서 강조한 근거 기반 응답과 답변 유보 능력이 독립 평가에서도 일부 확인된 셈입니다.

42는 무엇을 측정합니까

Artificial Analysis의 Intelligence Index v4.1.1 방법론은 9개 평가를 네 범주로 묶습니다.

범주 가중치 포함 평가
에이전트 34% GDPval-AA v2, τ³ Banking, Terminal-Bench v2.1
코딩 24% SciCode
과학 추론 24% Humanity's Last Exam, GPQA Diamond, CritPt
일반 18% AA-LCR, AA-Omniscience

따라서 42점은 단순 지식 시험의 평균이 아닙니다. 파일과 터미널을 다루고, 직업 과제를 수행하고, 긴 문서를 읽으며, 모를 때 답을 유보하는 능력을 상당 부분 반영합니다. Solar Pro 4의 방향과 평가 체계가 잘 맞아떨어진 결과입니다.

동시에 지수의 경계도 분명합니다. 현재 평가는 텍스트 전용이고 영어 중심입니다. 42점만으로 한국어·일본어 업무 품질, 멀티모달 문서 이해, 실제 기업 시스템에서의 보안과 안정성을 입증할 수는 없습니다. 개별 벤치마크는 실행 하네스와 추론 예산에 영향을 받으며, 종합 지수의 1점 차이보다 반복 측정의 분산이 클 수도 있습니다.

모델 페이지에는 Solar Pro 4가 비교 대상 165개 가운데 12위로 표시됩니다. 그러나 전체 리더보드는 같은 모델의 추론 강도와 설정을 별도 행으로 세기도 합니다. 이 숫자를 곧바로 "세계 12위"로 번역하기보다, 동급 가격대에서 선두권에 진입한 신호로 읽는 편이 정확합니다.

세 개의 리더보드는 서로 다른 질문을 합니다

Solar Pro 4에는 현재 세 종류의 외부 숫자가 붙어 있습니다. Artificial Analysis 종합 지수 42, Arena 텍스트 166위, Arena 에이전트 44위입니다. 순위 차이가 큰 이유는 평가가 모순돼서가 아니라 질문이 다르기 때문입니다.

같은 모델을 세 개의 다른 자로 재면 순위도 달라집니다Artificial Analysis42표준화된 9개 평가의 종합 지수에이전트 34%코딩 24% · 과학 24%일반 18%질문: 정해진 일을 얼마나 푸는가Arena Text166위익명 대결에서 사용자가 선호한 답변2,433표Elo 1,378순위 구간 146~182위질문: 어떤 답을 더 선호하는가Arena Agent44위실행 과정의 다섯 행동 신호4,150 세션141,723 관찰순위 구간 41~46위질문: 도구로 일을 완수하는가텍스트 Arena의 초기 순위는 표본이 적어 넓게 움직일 수 있습니다. 에이전트 순위도 세션이 쌓이며 변합니다.출처: Artificial Analysis 및 Arena 공개 리더보드, 2026년 8월 13일 조회.
종합 벤치마크, 사람의 답변 선호, 에이전트 실행 평가는 같은 모델의 서로 다른 면을 측정합니다.

Artificial Analysis 42는 표준 과제 성능입니다

같은 프롬프트와 평가 규칙으로 여러 모델을 비교하기 때문에 전작과의 세대 개선을 확인하기 좋습니다. 반면 실제 사용자 선호나 한국어 업무를 그대로 대변하지는 않습니다.

Arena 텍스트 166위는 첫 시장 검증의 출발점입니다

Arena 공개 리더보드에서 solar-pro4-20260805는 2,433표, Elo 약 1,378, 전체 텍스트 166위로 표시됩니다. 추정 순위 구간은 146위에서 182위로 넓습니다. 상위 모델이 수만 표를 보유한 것과 비교하면 아직 초기 표본입니다. 정식 등재 자체는 전 세계 사용자에게 익명으로 선택받는 비교 무대에 들어갔다는 의미가 있지만, 현재 결과를 텍스트 대화 상위권이라고 부를 수는 없습니다.

일부 소개에서 쓰인 "한국 모델 최초 Arena 등재"라는 표현은 공개 기록만으로 확인되지 않습니다. 현재 Arena 데이터에는 업스테이지의 과거 solar-10.7b-instruct-v1.0도 남아 있습니다. 이번에 확인 가능한 사실은 Solar Pro 4가 최신 상용 모델로 Arena 리더보드에 정식 등재됐다는 것입니다.

Arena 에이전트 44위는 업무 행동의 외부 신호입니다

Arena의 별도 에이전트 평가는 명시적 과제 성공, 사용자 칭찬과 불만, 지시 수정 수용, 셸 오류 복구, 도구 사용 환각 같은 다섯 신호를 집계합니다. Solar Pro 4는 4,150개 세션과 14만1,723개 관찰을 바탕으로 44위에 표시됩니다.

바로 위 MiniMax M2.7은 43위, 바로 아래 NVIDIA Nemotron 3 Ultra는 45위입니다. 세 모델의 추정 순위 구간이 서로 겹치므로 현 시점에는 어느 하나가 통계적으로 확실히 우위라고 보기 어렵습니다. "동등 수준"이라는 표현은 단일 순위 숫자보다 같은 통계 구간에 있다는 의미에서 타당합니다. 다만 MiniMax는 3만672개, Nemotron은 1만1,935개 세션이 쌓여 있어 Solar Pro 4의 44위는 앞으로 더 움직일 가능성이 큽니다.

무엇이 점프를 만들었습니까

Solar Pro 4의 공개 자료는 사전학습 규모보다 후반학습과 업무 환경을 강조합니다. 업스테이지 발표에 따르면 모델은 영어·한국어·일본어를 지원하고, 512K 문맥과 최대 128K 출력을 제공하며, 사용자가 추론 강도를 조절할 수 있습니다.

학습의 배경에는 Solar Open 2에서 공개한 OfficeVerse가 있습니다. 11개 산업과 12개 과제 유형을 교차해 문서·스프레드시트·프레젠테이션·PDF를 다루는 업무 환경을 만들고, 도구 실행 결과와 최종 산출물을 검증해 학습 신호로 사용했습니다. 강화학습 방법론보다 환경·검증기·비동기 실행 체계가 어려운 이유는 앞서 발행한 에이전트 강화학습 인프라 분석에서 다뤘습니다.

이번 세대의 변화는 Solar Open 2와 Pro 4 비교에서도 드러납니다. 업스테이지가 같은 평가 환경에서 공개한 수치에 따르면 Terminal-Bench v2.1은 43.2%에서 57.0%, GDPval은 31.4%에서 38.8%, 장문 추론은 62.7%에서 71.0%로 상승했습니다. 반면 MMLU는 86.2%에서 86.3%, LiveCodeBench는 87.0%에서 87.8%로 변화가 작았습니다.

이는 지식량 전체가 갑자기 세 배 늘었다기보다 업무 궤적을 오래 유지하고, 도구 오류를 복구하며, 긴 근거에서 필요한 정보를 찾는 후반학습이 제품화 단계에서 더해졌다는 신호입니다. 다만 회사 공개 비교에는 내부 하네스로 측정한 항목도 포함되므로, 세부 인과관계를 확정하려면 동일 기본 모델에서 후반학습 전후를 비교한 제거 실험이 더 필요합니다.

성능 상승에는 비용이 붙었습니다

Solar Pro 4는 무조건적인 상위 호환이 아닙니다. Artificial Analysis 실측 생성 속도는 초당 59.4토큰으로 Solar Pro 3의 123.9토큰보다 약 52% 낮습니다. 표준 API 요금은 입력 100만 토큰당 0.30달러, 출력 1.20달러로 전작의 두 배입니다. 같은 지수 평가에서 모델이 생성한 출력 토큰도 약 1억6,000만 개로 전작의 1억2,000만 개보다 약 33% 많았습니다.

반대편에는 4배 긴 문맥, 훨씬 높은 장기 업무 성공률, 낮아진 환각이 있습니다. 실무에서는 토큰 가격보다 성공한 업무 한 건의 총비용이 더 중요합니다. 한 번에 끝내는 비율이 높아져 재시도와 사람의 수정 시간이 줄면 느리고 비싼 모델이 더 경제적일 수 있습니다. 반대로 단순 질의나 지연시간이 중요한 서비스에서는 전작 또는 더 작은 모델이 낫습니다.

따라서 다음 검증은 벤치마크 점수보다 실제 업무 단위로 이뤄져야 합니다.

  • 같은 업무를 성공할 때까지 사용한 총 입력·출력 토큰과 지연시간
  • 한국어·일본어 장문 문서에서의 근거 정확도와 답변 유보율
  • 스프레드시트·프레젠테이션 산출물의 사람 검수 시간
  • 도구 오류가 발생했을 때 복구율과 잘못된 시스템 변경률
  • 추론 강도별 성공률, 비용, 응답시간의 곡선

Top 10은 가까운 순위이자 아직 큰 점수 차이입니다

Solar Pro 4 모델 페이지의 비교 순위는 12위로 표시돼 Top 10이 가까워 보입니다. 그러나 현재 Artificial Analysis 최상위 점수는 60점대 초반이고 Solar Pro 4는 42점입니다. 한두 순위만 올리면 되는 문제가 아니라, 프런티어 모델과 약 20점의 종합 성능 차이를 줄여야 하는 과제입니다.

Top 10 진입을 지속 가능한 성취로 만들려면 네 가지가 필요합니다.

  1. 긴 업무의 꼬리 실패를 줄여야 합니다. 평균 점수보다 드문 도구 환각, 상태 손실, 복구 실패가 실제 배포를 막습니다.
  2. 속도와 장황함을 함께 개선해야 합니다. 현재 품질 상승은 낮은 생성 속도와 더 많은 출력 토큰을 동반합니다.
  3. Arena 표본을 쌓아 순위를 안정화해야 합니다. 텍스트 2,433표와 에이전트 4,150세션은 방향을 보는 초기 데이터입니다.
  4. 한국어 업무의 독립 평가가 필요합니다. 영어 중심 지수에서의 성공이 강점이지만, 한국 모델의 차별점은 한국어 실무에서도 외부 재현돼야 합니다.

Solar Pro 4의 가장 큰 성과는 국산 모델이라는 수식어가 아닙니다. 외부 기관의 현행 평가 체계에서 전작보다 큰 폭으로 상승했고, 글로벌 에이전트 리더보드에서 MiniMax와 NVIDIA 모델이 있는 비교 구간에 진입했다는 점입니다. 과거에는 한국어 능력과 비용 효율이 주된 비교 축이었다면, 이제는 장기 업무 수행과 도구 사용이라는 글로벌 경쟁 축에서 평가받기 시작했습니다.

14 → 42는 끝이 아니라 모델 개발 방식이 바뀌었다는 증거에 가깝습니다. 다음 도약은 더 많은 정답을 아는 것만으로 만들기 어렵습니다. 실제 환경에서 실패를 수집하고, 검증 가능한 보상으로 바꾸고, 긴 업무의 성공률을 높이면서 속도와 비용을 다시 낮춰야 합니다. Solar Pro 4는 Top 10을 선언하기 전에 필요한 첫 번째 조건, 외부 평가에서 반복 개선을 증명하는 단계에 들어섰습니다.


주요 공개 자료

이 글은 공개된 모델·벤치마크 자료를 바탕으로 한 기술 분석이며 투자 권유가 아닙니다. 리더보드 점수와 순위는 조회 시점, 평가 버전, 표본 증가에 따라 달라질 수 있습니다.

YS-VC | Founder Intake Desk — Intervest