← Back to list

더 큰 모델보다 더 좋은 세계: SPADE가 환경 설계를 학습시켰습니다

SPADESelf-Play강화학습Agentic AISelf-Improving AISynthetic EnvironmentsRLVR

AI 에이전트가 계속 똑똑해지려면 더 많은 문제를 풀어야 합니다. 그런데 모델의 능력이 빠르게 높아질수록 사람이 미리 만든 문제집은 금방 쉬워집니다. 반대로 무작정 어려운 문제를 생성하면 정답에 도달할 단서가 없고, 검증도 불가능한 문제가 쌓입니다. 모델은 성장했는데 훈련 세계는 고정되어 있는 모순입니다.

2026년 8월 공개된 워싱턴대학교·스탠퍼드대학교·MIT·CMU·서울대학교 등 공동 연구진의 SPADE 논문은 이 병목을 정면으로 다룹니다. SPADE는 Self-Play in Adaptive Synthetic Executable Environments, 즉 적응형 합성 실행 환경에서의 자기대전을 뜻합니다.

핵심은 훈련 데이터를 더 많이 생성하는 데 있지 않습니다. 환경을 설계하는 행위 자체를 학습 대상으로 바꾼 데 있습니다. 하나의 언어모델이 훈련 세계를 만드는 환경 설계자와 그 세계에서 문제를 푸는 추론 에이전트 역할을 함께 맡습니다. 에이전트가 발전하면 설계자도 더 어려운 환경을 만들도록 함께 업데이트됩니다.

이 논문이 제시하는 다음 스케일링 단위는 파라미터나 정적 데이터셋만이 아닙니다. 모델이 배우는 실행 가능한 경험의 공급망입니다.

핵심 주장
SPADE의 의미는 AI가 문제를 생성한다는 데 있지 않습니다. 상태 전이, 도구, 보상, 검증기를 포함한 훈련 세계를 만들고, 학습자의 현재 능력에 맞춰 그 세계의 난이도까지 진화시킨다는 데 있습니다.

고정 문제집은 왜 금방 낡는가

언어모델의 사후학습에는 사람이 만든 문제, 고정된 합성 데이터, 정해진 검증기가 널리 사용됩니다. 모델이 약할 때는 효과적입니다. 정답이 명확하고 반복 가능한 훈련 신호를 주기 때문입니다.

하지만 학습이 진행될수록 세 가지 문제가 생깁니다.

첫째, 쉬운 문제의 비중이 커집니다. 이미 안정적으로 푸는 문제에서는 정책을 더 개선할 신호가 거의 나오지 않습니다.

둘째, 어려운 문제라고 모두 좋은 문제는 아닙니다. 풀 수 없는 문제, 모호한 문제, 잘못 구현된 문제는 실패만 반복하게 할 뿐 학습 경로를 제공하지 않습니다.

셋째, 정적 분포에 과적합될 수 있습니다. 같은 유형의 문제와 검증 규칙을 반복하면 벤치마크 점수는 오르더라도 새로운 환경에 적응하는 능력은 충분히 자라지 않을 수 있습니다.

교육에 비유하면 학생의 실력이 계속 변하는데 교재는 첫날 그대로인 상황입니다. 필요한 것은 문제 수의 무한 증식이 아니라, 현재 실력보다 조금 어려운 과제를 계속 공급하는 적응형 커리큘럼입니다.

SPADE는 문제 대신 환경을 생성합니다

SPADE가 생성하는 것은 단순한 질문과 정답 쌍이 아닙니다. 환경 설계자는 Python 코드로 긴 호흡의 상호작용 환경을 작성합니다. 각 환경은 OpenAI Gym과 유사한 reset()step() 인터페이스를 갖습니다.

  • reset()은 세계의 초기 상태를 만듭니다.
  • step(action)은 에이전트의 행동을 받아 다음 상태로 이동시킵니다.
  • 보상 함수는 행동의 결과가 얼마나 좋았는지 점수로 반환합니다.
  • 검증 코드는 규칙 준수와 과제 완료 여부를 확인합니다.
  • 특권 힌트는 풀 수 있는 경로가 존재하는지 확인하고 난이도를 측정하는 기준이 됩니다.

예를 들어 단순한 수학 문항을 만드는 대신, 여러 차례 도구를 호출해 숨겨진 변수를 찾고 조건을 충족해야 끝나는 시뮬레이션을 만들 수 있습니다. 도구 사용 환경이라면 가상의 API, 백엔드 상태, 사용자 요청, 단계별 검증 규칙까지 코드 안에 포함됩니다.

이 차이는 중요합니다. 질문 생성은 대체로 한 번의 입력과 출력에 머뭅니다. 실행 환경은 상태, 행동, 결과, 다음 상태가 이어지는 다단계 경험을 만듭니다. 에이전트는 답을 맞히는 것뿐 아니라 관찰하고, 시도하고, 실패를 복구하고, 목표 상태에 도달하는 법을 배웁니다.

SPADE의 공동 진화 학습 구조문서 코퍼스와 환경 메모리를 받은 환경 설계자가 실행 환경과 힌트를 만들고, 추론 에이전트가 힌트 유무 두 조건에서 행동한 뒤 보상 차이를 이용해 두 역할이 공유하는 정책을 업데이트하는 순환 구조SPADE: 환경과 학습자가 함께 어려워지는 순환문서 코퍼스주제와 지식의 폭환경 메모리과거 환경·후회값환경 설계자Python 환경보상·검증기특권 힌트추론 에이전트의 두 번의 도전힌트 없이실전 성과힌트 포함도달 가능성힌트 기반 후회값 + 난이도 목표너무 쉽지도, 불가능하지도 않은 환경에 보상하나의 정책, 두 역할별 학습 신호가중치는 공유하고 학습 신호는 분리
SPADE의 학습 루프. 환경 설계와 문제 해결이 같은 정책 안에서 공동 진화하지만, 각 역할의 학습 신호는 분리해 계산합니다. 출처: SPADE 논문을 바탕으로 재구성.

한 모델이 설계자와 학습자를 함께 맡습니다

SPADE에서는 하나의 LLM이 역할 프롬프트에 따라 두 역할을 수행합니다.

환경 설계자(Environment Designer)는 문서 코퍼스와 이전 환경의 기록을 참고해 새로운 실행 환경을 작성합니다. 환경의 규칙, 상태 전이, 보상 함수, 검증 코드, 특권 힌트를 모두 생성합니다.

추론 에이전트(Reasoning Agent)는 생성된 환경에 들어가 여러 차례 행동합니다. 게임형 환경에서는 명령을 실행하며 목표를 달성하고, 도구 사용 환경에서는 API를 호출해 사용자 요청을 순서대로 처리합니다.

두 역할은 기반 모델의 가중치를 공유합니다. 따라서 에이전트가 어떤 환경에서 학습을 잘하는지 얻은 신호가 환경 설계 능력에도 반영되고, 더 나은 환경에서 얻은 경험이 다시 에이전트를 개선합니다. 다만 학습은 무작정 섞지 않습니다. 논문은 역할별 advantage를 별도로 정규화하고 환경 설계자의 업데이트를 지연시키는 등 공동학습의 불안정을 줄이는 장치를 사용합니다.

이 구조는 단순한 에이전트 하네스 개선과도 다릅니다. 메모리나 도구만 바꾸는 것이 아니라, 생성된 경험으로 정책 가중치까지 강화학습합니다. 따라서 모델 바깥의 메모리·스킬·도구가 진화하는 방식과 연결되지만, SPADE는 그 경험을 다시 모델 학습으로 환류시키는 더 안쪽의 루프까지 포함합니다.

힌트의 가치 차이가 커리큘럼을 만듭니다

환경 설계자가 단순히 에이전트를 실패시키는 어려운 환경만 만들면 학습은 무너집니다. SPADE는 이 문제를 힌트 기반 후회값(hint-based regret)으로 다룹니다.

같은 환경에서 추론 에이전트가 두 번 도전합니다.

  1. 특권 힌트 없이 문제를 풉니다.
  2. 환경 설계자가 만든 특권 힌트를 보고 다시 풉니다.
  3. 힌트가 있을 때와 없을 때의 보상 차이를 계산합니다.

개념적으로 설계자의 보상은 다음과 같습니다.

힌트 기반 후회값 = 힌트가 있을 때의 평균 보상 - 힌트가 없을 때의 평균 보상

에이전트가 힌트 없이도 쉽게 성공하면 차이가 작습니다. 힌트가 있어도 실패하면 역시 차이가 작습니다. 힌트를 받았을 때는 성공하지만 스스로는 아직 어려워하는 환경에서 차이가 커집니다. 바로 이 구간이 현재 능력의 경계입니다.

논문의 실제 구현은 순수한 후회값만 사용하지 않습니다. 환경 설계자의 보상은 대략 정규화한 후회값 40%와 힌트 없는 에이전트의 성공률을 40~60% 구간으로 유도하는 난이도 보상 60%를 결합합니다. 저자들이 후회값만으로는 환경 난이도가 흔들릴 수 있다고 보고, 풀 수 있는 중간 난이도에 추가로 닻을 내린 것입니다.

힌트 기반 후회값이 선택하는 학습 구간너무 쉬운 환경과 불가능한 환경은 학습 신호가 작고, 힌트를 사용하면 풀 수 있지만 힌트 없이는 어려운 능력 경계 환경에서 학습 신호가 가장 큼좋은 환경은 가장 어려운 환경이 아니라, 다음에 풀 환경입니다너무 쉬움힌트 없이 성공힌트가 추가한 가치 작음학습 신호 ↓능력의 경계힌트가 있으면 성공힌트 없이는 아직 어려움학습 신호 ↑사실상 불가능힌트가 있어도 실패도달할 경로가 없음학습 신호 ↓환경 난이도
힌트 기반 후회값의 직관. 설계자는 실패율을 최대화하는 것이 아니라, 힌트가 학습 가능한 경로를 열어주는 환경을 찾습니다.

힌트는 정답을 가르치는 장치인 동시에 환경의 유효성을 검사하는 장치입니다. 힌트가 있어도 풀 수 없다면 환경 코드가 잘못되었거나 목표가 지나치게 어려울 가능성이 큽니다. 검증 가능한 결과를 넘어, 학습 가능한 경로가 있는지를 측정하는 검증기가 추가된 셈입니다.

코퍼스와 메모리가 환경 붕괴를 막습니다

생성 모델에게 자유롭게 환경을 만들게 한다고 다양성이 저절로 생기지는 않습니다. 모델은 익숙한 형태를 반복하거나, 겉모습만 다른 비슷한 과제를 만들 수 있습니다. SPADE는 두 가지 외부 구조로 이 문제를 완화합니다.

첫째는 코퍼스 기반 설계입니다. 게임 환경에는 수학·과학 문서 1만5천 건, 도구 사용 환경에는 코드 문서 1만5천 건을 표본으로 제공했습니다. 설계자는 문서를 그대로 문제로 바꾸는 것이 아니라, 새로운 환경의 주제와 메커니즘을 만드는 재료로 사용합니다.

둘째는 누적 환경 메모리입니다. 이전에 만든 환경, 관측된 후회값, 기술 태그를 기록해 설계자에게 제공합니다. 코퍼스가 탐색 범위를 넓힌다면 메모리는 이미 탐색한 영역과 현재 난이도를 알려줍니다.

저자들의 30B 게임 실험에서 전체 SPADE의 8개 평가 평균은 58.3점이었습니다. 메모리를 제거하면 53.2점, 코퍼스를 제거하면 53.5점으로 낮아졌습니다. 코퍼스 없이 생성한 환경은 동일한 회전 미로 유형을 41회 반복하기도 했습니다. 다양성을 모델의 창의성에만 맡기지 않고 외부 지식과 이력으로 구조화해야 한다는 결과입니다.

저자 실험에서 무엇이 얼마나 좋아졌는가

논문은 Qwen3 계열 4B, 8B, 30B-A3B 모델을 사용해 게임형 추론과 도구 사용 환경을 실험했습니다. 게임 실험은 훈련에 사용하지 않은 수학·과학·코드·추론 벤치마크 8개로 전이 성능을 측정했습니다.

모델 기본 모델 평균 고정 환경 RLVE SPADE 기본 모델 대비
Qwen3 4B 38.9 42.5 44.1 +5.2
Qwen3 8B 49.8 53.8 55.5 +5.7
Qwen3 30B-A3B 50.2 53.0 58.3 +8.1

가장 큰 30B-A3B에서 SPADE는 가장 강한 고정 환경 기준선보다 평균 5.3점 높았습니다. 모델이 커질수록 SPADE의 이점이 5.2점, 5.7점, 8.1점으로 증가한 것도 눈에 띕니다. 고정 환경에서의 GRPO 개선 폭은 30B에서 약 1.2점에 머물렀습니다. 저자들은 큰 모델일수록 더 유효하고 어려운 환경을 만들 수 있어 공동 진화의 이득이 커진다고 해석합니다.

도구 사용 실험에서는 30B-A3B 모델이 다음과 같이 개선되었습니다.

평가 기본 모델 SPADE 변화
BFCL v4 Multi-turn 49.0 54.7 +5.7
τ²-bench 49.0 52.6 +3.6
ACEBench-Agent 62.0 75.9 +13.9

특히 ACEBench-Agent의 13.9점 상승은 큽니다. 다만 이를 일반적인 에이전트 능력 전체가 13.9점 좋아졌다고 읽어서는 안 됩니다. SPADE가 만든 도구 사용 환경은 상태가 있는 API와 여러 사용자 지시를 순차적으로 처리한다는 점에서 해당 평가와 구조적으로 잘 맞습니다. 논문도 다른 환경 합성 연구와는 기반 모델, 데이터, 연산량, 평가 프로토콜이 달라 직접적인 일대일 비교가 어렵다고 명시합니다.

2026년 8월 19일 공개된 논문은 아직 work in progress로 표시된 v1 프리프린트입니다. 수치는 저자 실험 결과이며 독립 재현 결과는 아직 축적되지 않았습니다. 코드와 체크포인트, 생성 환경 데이터가 공개되어 있다는 점은 검증 가능성을 높이지만, 현재 저장소의 이력과 외부 재현 규모는 초기 단계입니다.

고정된 강한 설계자만으로는 충분하지 않았습니다

흥미로운 비교는 더 강한 폐쇄형 모델을 고정 환경 생성기로 사용한 기준선입니다. GPT-5.5로 만든 정적 환경에서 학습한 30B 모델의 평균은 53.0점이었습니다. SPADE의 58.3점보다 5.3점 낮습니다. 저자 계산으로는 정적 강한 설계자가 전체 8.1점 개선의 약 35%만 회수했습니다.

이는 한 번에 더 좋은 문제를 만드는 능력과, 학습자의 변화에 맞춰 문제 분포를 계속 움직이는 능력이 다르다는 뜻입니다. 좋은 교재 한 권보다 학생의 오답과 성장 속도를 보고 다음 과제를 고르는 교사가 더 중요할 수 있습니다.

반대 실험도 경고를 줍니다. 설계자와 에이전트를 같은 모델로 두되 코퍼스와 메모리 없이 공동학습하면 평균이 40.5점으로 기본 모델보다 9.7점 낮아졌습니다. 자기대전이라는 형식만 붙이면 자동으로 개선되는 것이 아닙니다. 외부 지식, 과거 경험, 실행 검증, 안정적인 보상 설계가 함께 있어야 합니다.

데이터 생성에서 실행 가능한 세계 생성으로

생성형 AI의 훈련 자산은 다음과 같이 확장되어 왔습니다.

  1. 사람이 작성한 정답 데이터
  2. 강한 모델이 만든 합성 질문과 답변
  3. 코드 실행이나 수학 검증기로 채점하는 검증 가능한 과제
  4. 상태 전이와 보상, 검증기를 포함한 실행 환경
  5. 학습자의 능력에 따라 환경 분포가 변하는 공동 진화 시스템

SPADE는 네 번째와 다섯 번째 단계를 연결합니다. 환경은 더 이상 데이터를 담는 수동적인 그릇이 아닙니다. 무엇을 경험하게 할지 결정하는 학습 가능한 정책이 됩니다.

이 변화는 정답 검증을 넘어 탐색 과정 자체를 학습시키려는 RLVR의 다음 단계와도 맞닿아 있습니다. 정답이 있는 문제를 많이 푸는 것에서 벗어나, 행동의 결과가 상태를 바꾸고 그 상태를 다시 관찰하는 경험을 공급합니다. 에이전틱 강화학습에서 중요한 인프라도 데이터 로더만이 아니라 환경 실행기, 샌드박스, 상태 저장소, 검증기, 롤아웃 오케스트레이터로 넓어집니다.

여기서 말하는 세계는 월드모델과 다릅니다

SPADE의 설명에서 자주 등장하는 ‘세계’라는 표현은 조심해서 해석해야 합니다. 이 연구가 현실의 물리 법칙을 내부 잠재상태로 학습하는 월드모델을 만든 것은 아닙니다.

SPADE의 세계는 코드로 명시된 마르코프 결정 과정(MDP)에 가깝습니다. 상태 전이와 보상 규칙이 Python 프로그램 안에 쓰여 있고, 에이전트는 정해진 인터페이스를 통해 행동합니다. 실제 세계를 압축해 예측하는 모델이라기보다 훈련을 위해 만든 실행 가능한 소프트웨어 세계입니다.

따라서 “AI가 스스로 세계를 만든다”는 문장은 사실이지만 범위를 붙여야 합니다. 현재 SPADE는 제한된 문서와 컨텍스트 안에서, 실행 가능한 Python 환경을 만들고, 구조·실행·해결 가능성 검사를 통과한 환경을 학습에 사용합니다. 현실의 인과구조를 자유롭게 발견하거나 무한히 새로운 과학 세계를 발명한 것은 아닙니다.

다음 스케일링 병목은 경험의 품질입니다

사전학습에서는 데이터와 연산량이 성능을 끌어올렸습니다. 에이전트 시대에는 추론 시간에 쌓이는 경험과 그 경험을 만드는 환경의 품질이 새로운 병목이 될 수 있습니다.

SPADE가 보여주는 변화는 세 가지입니다.

1. 환경이 적응형 커리큘럼이 됩니다

고정된 데이터셋은 학습자가 성장해도 그대로입니다. SPADE의 환경 분포는 에이전트 성능을 보며 이동합니다. 학습 데이터의 생산이 모델 업데이트와 분리된 사전 공정이 아니라 온라인 학습 루프의 일부가 됩니다.

2. 검증기가 세계의 일부가 됩니다

RLVR에서는 정답을 맞혔는지 확인하는 검증기가 중요했습니다. 실행 환경에서는 검증기의 역할이 더 커집니다. 상태가 올바르게 바뀌었는지, 여러 단계의 조건을 지켰는지, 보상이 조작되지 않았는지까지 판정해야 합니다. 신뢰할 수 없는 모델을 신뢰할 수 있는 시스템으로 바꾸는 검증 루프가 환경 내부로 들어갑니다.

3. 모델이 성장할수록 경험도 어려워집니다

정적 합성 데이터는 강한 모델이 소비한 뒤 낡습니다. 적응형 환경 설계자는 학습자의 현재 경계에서 새로운 경험을 계속 만들 수 있습니다. 논문의 스케일별 결과가 유지된다면, 큰 모델은 더 좋은 답을 내는 동시에 더 좋은 훈련 세계를 만드는 능력도 함께 갖게 됩니다.

기업의 해자는 모델보다 환경에 생길 수 있습니다

범용 모델은 여러 기업이 비슷한 시기에 사용할 수 있습니다. 그러나 특정 산업의 좋은 실행 환경을 만드는 데 필요한 자산은 쉽게 복제되지 않습니다.

  • 업무의 실제 상태를 표현하는 스키마
  • 행동이 상태를 어떻게 바꾸는지 정의한 전이 규칙
  • 성공과 실패를 판정하는 검증기
  • 부분 성공에 보상을 주는 세밀한 평가 기준
  • 실패 사례와 예외 상황이 축적된 환경 메모리
  • 안전하게 코드를 실행하고 데이터를 격리하는 샌드박스

예를 들어 기업용 구매 에이전트를 훈련하려면 제품 문서를 많이 모으는 것만으로 부족합니다. 권한, 예산, 공급업체 상태, 승인 순서, 계약 조건, 예외 처리까지 재현하는 환경이 필요합니다. 병원 운영, 제조 공정, 금융 백오피스, 클라우드 운영에서도 마찬가지입니다.

이 관점에서는 독점 데이터의 의미도 달라집니다. 문서의 양보다 검증 가능한 상태 변화와 결과를 재현할 수 있는가가 중요해집니다. 실제 업무를 시뮬레이션하고 안전하게 반복할 수 있는 기업은 같은 기반 모델을 사용해도 더 좋은 경험을 공급할 수 있습니다.

파급효과는 훈련 인프라 전체로 번집니다

환경 생성이 학습 루프 안으로 들어오면 필요한 시스템도 달라집니다.

첫째, 롤아웃 비용이 커집니다. SPADE는 환경 하나를 생성한 뒤 실행 검사를 하고, 에이전트를 힌트 유무 조건에서 반복 실행합니다. 공개된 30B 게임 설정은 8-GPU 노드에서 400회의 롤아웃 단계를 사용합니다. 단순한 질문·답변 생성보다 훨씬 무거운 파이프라인입니다.

둘째, 샌드박스가 핵심 학습 인프라가 됩니다. 모델이 작성한 Python 환경을 그대로 실행하면 무한 루프, 과도한 자원 사용, 파일·네트워크 접근, 악성 코드 문제가 생길 수 있습니다. 실행 시간, 메모리, 시스템 호출, 외부 연결을 제한하고 환경별 격리를 보장해야 합니다.

셋째, 환경 레지스트리와 계보 관리가 필요합니다. 어떤 코퍼스에서 어떤 환경이 만들어졌고, 어떤 모델 버전이 그 환경에서 학습했으며, 보상식과 검증기가 어떻게 바뀌었는지 추적해야 합니다. 데이터 계보가 환경과 코드 계보로 확장됩니다.

넷째, 에이전트 평가와 훈련의 경계가 흐려집니다. 실패한 평가 궤적은 다음 환경 설계의 재료가 되고, 새 환경은 다시 모델 학습과 회귀 테스트에 사용됩니다. 운영 중 얻은 경험을 학습으로 환류하려면 개인정보, 고객 데이터, 권한 기록을 분리하는 거버넌스가 필요합니다.

아직 해결하지 못한 문제들

SPADE는 개방형 자기개선으로 가는 구체적인 한 걸음이지만, 무제한 재귀적 자기개선은 아닙니다. 논문 자체가 여러 한계를 밝힙니다.

모델이 만든 세계는 모델의 시야를 넘기 어렵습니다

환경 설계자와 추론 에이전트가 같은 정책을 공유하면 공동 진화가 가능하지만 공통의 맹점도 공유합니다. 논문은 이를 모델 규모, 컨텍스트, 생성 능력이 만드는 ‘보이지 않는 목줄’로 표현합니다. 모델이 상상하지 못하는 과제는 환경에도 나타나기 어렵습니다.

학습 알고리즘 자체는 사람이 고정했습니다

SPADE는 환경 설계 정책을 학습하지만, 최적화 방식은 사람이 정한 GRPO를 사용합니다. 모델이 스스로 새로운 학습 규칙이나 최적화 알고리즘을 발명해 교체하는 구조는 아닙니다.

후회값이 최적 커리큘럼이라는 보장은 없습니다

힌트 기반 후회값은 직관적이고 실험에서 작동했지만, 가장 좋은 학습 순서를 항상 찾는다는 증명은 없습니다. 이론 분석도 힌트가 최적 행동의 가치를 제공하고 그 행동을 힌트 없이 내재화할 수 있다는 강한 가정에 기대고 있습니다.

보상 해킹의 표면이 넓어집니다

환경 설계자가 보상과 검증 코드까지 만들면 학습 신호 자체를 쉽게 만드는 편법이 생길 수 있습니다. 에이전트가 목표를 달성하지 않고도 보상을 받거나, 설계자가 후회값을 높이기 위해 힌트에 정답을 과도하게 노출할 수 있습니다. 환경 코드와 검증기에 대한 별도 감사가 필요합니다.

고정 벤치마크 개선은 개방형 성장과 다릅니다

SPADE는 훈련하지 않은 고정 평가에서 전이 성능을 높였습니다. 이는 의미 있는 결과지만, 시간이 지나도 끝없이 새로운 능력을 획득한다는 증거는 아닙니다. 장기간 학습에서 환경 다양성이 유지되는지, 새로운 능력이 누적되는지, 이전 능력을 잊지 않는지는 더 긴 검증이 필요합니다.

출처와 안전성이 일급 설계 대상이 됩니다

환경이 외부 문서를 바탕으로 생성되면 출처, 라이선스, 개인정보, 편향이 코드와 보상 규칙에 스며들 수 있습니다. 잘못된 문서가 잘못된 세계의 규칙이 될 수도 있습니다. 환경 생성의 provenance와 승인 절차는 데이터 정제만큼 중요해집니다.

좋은 세계가 더 큰 모델을 보완합니다

SPADE가 파라미터 스케일링의 종말을 뜻하지는 않습니다. 오히려 논문의 실험은 큰 모델일수록 환경 공동 진화의 이득이 커질 수 있음을 보여줍니다. 더 강한 모델과 더 좋은 세계는 대체재라기보다 보완재입니다.

다만 경쟁의 질문은 바뀝니다.

과거에는 “누가 더 큰 모델을 학습하는가”가 중심이었다면, 앞으로는 다음 질문이 중요해집니다.

  • 누가 유효한 실행 환경을 더 빠르게 만들 수 있는가
  • 누가 현실 업무의 상태 전이와 예외를 더 정확히 재현하는가
  • 누가 보상과 검증기의 무결성을 보장하는가
  • 누가 실패 경험을 다음 커리큘럼으로 바꾸는가
  • 누가 생성된 코드를 안전하고 저렴하게 대규모 실행하는가

AI가 학습할 데이터가 고갈된다는 논의는 텍스트의 양만 보면 타당합니다. 하지만 실행 가능한 환경에서는 같은 지식에서도 다양한 상태와 행동, 실패와 복구의 궤적을 만들 수 있습니다. 경험은 문서에서 한 번 추출되는 것이 아니라 상호작용 속에서 생성됩니다.

SPADE의 가장 큰 의미는 모델이 자신에게 유리한 정답을 만든다는 데 있지 않습니다. 자신이 아직 잘하지 못하지만 배울 수 있는 경험을 만드는 정책을 학습시켰다는 데 있습니다.

다음 세대의 에이전트 경쟁은 주어진 세계를 누가 더 잘 푸는가에만 머물지 않을 수 있습니다. 누가 더 안전하고 다양하며 검증 가능한 학습 세계를 만들고, 그 세계를 모델의 성장 속도에 맞춰 진화시키는가가 새로운 경쟁 축이 될 수 있습니다.

파라미터 다음의 스케일링 프런티어는 더 좋은 세계입니다. 정확히는 더 좋은 경험을 끊임없이 생산하는 실행·검증 시스템입니다.


참고 자료

YS-VC | Founder Intake Desk — Intervest