← Back to list

토큰은 기록이고 State는 세계에 대한 가설입니다

TransformerFrontier LLMWorld ModelCausal AIState인과 추론AI 아키텍처

현재의 프런티어 LLM은 2017년에 발표된 Transformer와 얼마나 다를까요. LLM과 월드모델은 모두 Transformer를 쓸 수 있는데 왜 서로 다른 종류의 모델이라고 부를까요. 언어모델은 수많은 인과관계가 적힌 문서를 읽었는데도 왜 원인과 상관관계를 자주 혼동할까요. 월드모델에서 말하는 state는 LLM의 token, hidden activation, KV cache와 무엇이 다를까요.

이 질문들은 모두 같은 혼동에서 출발합니다. 신경망의 계산 블록, 학습 목표, 내부 표현, 행동하는 시스템을 하나의 아키텍처라고 뭉뚱그리는 것입니다.

Transformer는 정보를 섞는 계산 방법입니다. LLM은 주로 다음 token을 예측하도록 학습한 모델입니다. 월드모델은 관찰에서 현재 상태를 추정하고, 행동에 따라 그 상태가 어떻게 변할지 예측하는 모델입니다. 인과모델은 관찰된 상관관계를 넘어 어떤 변수를 강제로 바꿨을 때 결과가 어떻게 달라지는지를 표현합니다.

같은 Transformer 블록을 사용해도 이 네 층의 선택이 다르면 전혀 다른 지능이 됩니다.

LLM은 기록에서 다음 표현을 예측하고, 월드모델은 상태에서 행동 이후의 세계를 예측하며, 인과모델은 개입하지 않았을 세계와 개입한 세계의 차이를 묻습니다.

현대 LLM은 Transformer를 버리지 않았습니다

2017년 Attention Is All You Need의 Transformer는 범용 대화형 AI가 아니었습니다. 영어 문장을 독일어 또는 프랑스어로 바꾸는 기계번역 모델이었습니다. 입력 문장을 읽는 encoder와 번역문을 생성하는 decoder가 각각 6개 층으로 구성됐습니다.

Encoder는 입력의 모든 token을 양방향으로 바라봤습니다. Decoder는 지금까지 생성한 token만 볼 수 있었고, encoder가 만든 입력 표현을 cross-attention으로 참조했습니다. 각 층에는 모든 token이 거치는 dense feed-forward network가 있었고, 순서는 절대적 sinusoidal positional encoding으로 표시했습니다.

현재 프런티어 LLM의 가장 깊은 뿌리는 여전히 이 구조입니다. Self-attention으로 token 사이의 관계를 계산하고, feed-forward network로 각 token의 표현을 변환하며, residual connection과 normalization으로 층을 쌓습니다. 바뀐 것은 이 기본 블록을 범용 생성, 초대형 학습, 긴 문맥, 멀티모달 입력과 효율적인 추론에 맞게 재설계한 방식입니다.

구분 2017년 Transformer 공개 구조로 확인 가능한 현대 프런티어 계열
주된 목적 기계번역 범용 텍스트·코드·멀티모달 생성과 도구 사용
전체 구조 Encoder 6층 + Decoder 6층 주로 decoder-only, 필요 시 vision·audio encoder 결합
Attention 일반 multi-head attention GQA·MQA·MLA 등 KV cache 절감 구조
FFN 모든 token이 같은 dense FFN 사용 Dense와 sparse MoE가 공존
위치 표현 절대 sinusoidal encoding RoPE와 장문맥 확장 기법
활성함수 ReLU SwiGLU 계열이 일반적
입력 단위 텍스트 subword 텍스트·이미지·영상·음성·행동 token 또는 latent
기본 학습 번역 정답 sequence 대규모 next-token prediction, 일부 multi-token prediction
후학습 제한적 SFT·선호학습·강화학습·증류·안전학습
실행 환경 단일 번역 모델 KV cache·추론 라우팅·도구·검색·메모리·에이전트 하네스

폐쇄형 프런티어 모델은 정확한 층 구성과 routing 방식을 모두 공개하지 않습니다. 따라서 현재 구조를 설명할 때는 공개 논문이 있는 대표 모델을 기준으로 봐야 합니다.

Decoder-only가 범용 인터페이스가 됐습니다

원래 Transformer는 입력과 출력을 서로 다른 network가 처리했습니다. GPT 계열의 decoder-only LLM은 질문, 문서, 코드, 답변을 하나의 token sequence로 연결하고 다음 token을 예측합니다.

p(x₁, ..., xₜ) = ∏ p(xₜ | x<ₜ)

이 단순한 목표는 웹문서, 책, 코드, 대화처럼 형식이 다른 데이터를 한 방식으로 학습할 수 있게 했습니다. 지식, 문법, 스타일, 프로그램 구조와 문제풀이의 흔적이 모두 다음 token 예측에 압축됩니다. 모델 규모와 데이터 규모를 함께 키우기 쉽다는 장점도 있습니다.

Dense와 MoE는 서로 다른 계산 전략입니다

Llama 3.1은 405B 파라미터가 모두 작동하는 dense Transformer를 선택했습니다. Meta는 구조의 새로움보다 데이터 품질, 규모와 안정적인 학습이 성능 향상의 주된 원인이라고 밝혔습니다. GQA, RoPE, 128K vocabulary와 장문맥 학습 같은 수정은 있었지만 기본 골격은 표준 Transformer에 가깝습니다.

반면 DeepSeek-V3는 총 671B 파라미터 중 token마다 약 37B를 활성화하는 sparse MoE를 사용했습니다. 모든 지식을 매번 계산하지 않고 router가 적합한 expert를 고릅니다. 여기에 key·value를 압축하는 Multi-head Latent Attention과 여러 미래 token을 함께 예측하는 Multi-Token Prediction을 적용했습니다.

Llama 4도 MoE를 채택했습니다. Maverick은 400B 전체 파라미터 가운데 17B가 활성화되고, 각 token은 shared expert와 routed expert 하나를 통과합니다. MoE의 목적은 단순히 모델을 크게 만드는 것이 아니라 저장된 지식의 총량과 한 token을 처리하는 계산량을 분리하는 것입니다.

Attention은 품질뿐 아니라 메모리 대역폭의 문제입니다

Autoregressive generation에서는 새 token을 만들 때마다 과거 token의 key와 value를 다시 계산하지 않도록 KV cache에 저장합니다. 문맥이 길고 batch가 커질수록 cache가 GPU 메모리를 차지하고 읽어오는 비용이 커집니다.

GQA는 여러 query head가 더 적은 key·value head를 공유합니다. MQA는 이를 한 쌍까지 줄이고, DeepSeek의 MLA는 key·value 표현을 작은 latent로 압축합니다. 초기 Transformer의 attention이 어떤 token을 볼 것인가에 초점을 맞췄다면, 현대 LLM의 attention 설계는 과거를 얼마나 싸게 저장하고 읽을 것인가까지 포함합니다.

멀티모달은 입력의 종류를 넓혔습니다

텍스트 외의 현실은 본래 token으로 주어지지 않습니다. 이미지는 patch 또는 vision encoder의 latent, 음성은 frame이나 codec token, 영상은 시공간 patch로 바뀝니다. 이후 cross-attention으로 언어모델에 연결하거나 모든 표현을 같은 backbone에 넣습니다.

Llama 4는 텍스트와 vision token을 초기부터 같은 backbone에서 학습하는 early fusion을 채택했습니다. 그러나 이미지 token을 처리한다고 해서 모델이 자동으로 물체의 지속성, 질량, 힘과 공간의 3차원 구조를 명시적으로 갖는 것은 아닙니다. 입력 modality가 넓어진 것과 세계의 동역학을 학습한 것은 다른 문제입니다.

Transformer는 유지됐고, 그 위아래의 시스템이 커졌습니다2017 TransformerEncoder + DecoderDense MHA + ReLU FFN번역 sequence현대 LLM backboneDecoder 중심·RoPEGQA·MLA·MoE·SwiGLU장문맥·멀티모달프런티어 AI 시스템Post-training·reasoningTools·retrieval·memoryAgent harness·evals바뀌지 않은 중심Self-attention으로 sequence의 정보를 섞고, feed-forward network로 표현을 변환합니다.주된 사전학습 목표도 여전히 다음 token 예측입니다.새로 커진 경계저장된 전체 파라미터와 token당 활성 계산을 MoE로 분리합니다.텍스트뿐 아니라 이미지·영상·음성을 같은 표현공간에 연결합니다.추론과 행동은 모델 하나가 아니라 도구·메모리·검증기를 포함한 시스템이 수행합니다.
현재 프런티어 성능을 Transformer block의 변화만으로 설명할 수 없습니다. 데이터, 후학습, inference-time compute와 agent system이 backbone만큼 중요해졌습니다.

같은 Transformer라도 학습 목표가 다르면 다른 모델입니다

Transformer는 미분 가능한 정보 혼합기입니다. 입력을 sequence로 바꾸고, 위치 사이의 관련도를 계산해 새로운 표현을 만듭니다. 무엇을 입력하고 어떤 오차를 줄이도록 학습시키는지는 Transformer 자체가 정하지 않습니다.

언어모델은 다음 token의 확률을 높입니다.

LLM: p(xₜ | x<ₜ)

시계열 모델은 과거 값에서 미래 값의 분포를 예측할 수 있습니다.

Forecasting model: p(yₜ₊₁:ₜ₊ₕ | y≤ₜ, covariates)

월드모델은 현재 상태와 행동을 조건으로 다음 상태를 예측합니다.

World model: p(sₜ₊₁, oₜ₊₁, rₜ | sₜ, aₜ)

세 모델 모두 Transformer를 사용할 수 있습니다. 하지만 언어모델의 sequence는 기록된 표현의 순서이고, 월드모델의 sequence는 행동으로 변화하는 환경의 궤적입니다. 언어모델은 그럴듯한 다음 문장을 만들면 학습목표를 달성하지만, 월드모델은 행동 후의 상태, 관찰과 보상을 일관되게 예측해야 합니다.

LLM과 월드모델의 경계는 State와 Action입니다

월드모델을 단순히 미래 영상을 만드는 모델로 정의하면 범위가 너무 좁습니다. 월드모델의 핵심은 내부에 환경의 상태를 만들고, 행동 이후 그 상태가 어떻게 변하는지 반복해서 계산할 수 있다는 점입니다.

일반적인 구성은 다음과 같습니다.

  1. Observation encoder: 이미지, 센서와 언어 관찰을 latent 표현으로 바꿉니다.
  2. State estimator: 과거 관찰과 행동을 결합해 현재의 숨은 상태를 추정합니다.
  3. Dynamics model: 현재 state와 action에서 다음 state의 분포를 예측합니다.
  4. Observation·reward model: 다음에 보일 것, 받을 보상과 episode 지속 여부를 예측합니다.
  5. Planner 또는 policy: 여러 action sequence를 상상하고 목표에 가장 적합한 행동을 고릅니다.
  6. Environment feedback: 실제 행동 결과를 받아 state와 dynamics를 수정합니다.
LLM은 sequence를 이어가고, 월드모델은 행동 가능한 세계를 굴립니다LLM과거 tokenx₁ ... xₜCausal Transformerp(xₜ₊₁ | x≤ₜ)다음 token 분포기록의 연속World model관찰 oₜ이미지·센서상태 추정 sₜ세계에 대한 belief동역학 f(sₜ,aₜ)행동 조건부 전이sₜ₊₁미래행동 aₜ여러 action을 굴려본 뒤 planner가 실제 행동을 고르고, 결과가 다시 관찰로 들어옵니다.차이는 Transformer 사용 여부가 아니라 state·action·transition·feedback의 존재입니다.
월드모델은 예측을 행동 선택에 다시 사용합니다. 모델의 상상과 실제 관찰 사이의 오차가 다음 state와 dynamics 학습으로 돌아옵니다.

DreamerV3는 이미지 관찰을 stochastic latent와 recurrent hidden state로 압축하고, 그 latent 공간에서 미래를 상상해 actor와 critic을 학습합니다. 모든 가능한 픽셀 미래를 완벽하게 복원하는 대신 행동 선택에 필요한 dynamics, reward와 episode continuation을 학습합니다.

MuZero는 더 과감합니다. 실제 게임 규칙이나 다음 화면 전체를 학습하지 않고 planning에 필요한 hidden state, reward, policy와 value를 예측합니다. 좋은 월드모델은 현실의 모든 세부사항을 복사하는 모델이 아니라 목표 달성에 필요한 상태와 전이만 보존하는 모델일 수 있다는 뜻입니다.

Genie 2는 video frame을 autoencoder latent로 압축한 뒤, 대형 Transformer dynamics model과 latent diffusion을 사용합니다. 과거 latent frame과 사용자의 keyboard action을 받아 다음 frame을 생성합니다. 같은 시작 화면에서 서로 다른 action을 넣어 다른 trajectory를 만들 수 있고, 화면 밖으로 사라진 장소를 다시 등장시킬 수 있습니다.

Genie 2가 보여주는 핵심은 월드모델도 Transformer를 쓴다는 사실입니다. Transformer는 모델의 정체가 아니라 dynamics를 계산하는 부품입니다. LLM은 token history를 조건으로 다음 token을, Genie 2는 latent world history와 action을 조건으로 다음 latent frame을 예측합니다.

질문 LLM 월드모델
기본 입력 기록된 token sequence 관찰·이전 행동·현재 목표
내부 중심 token별 contextual representation 환경의 latent 또는 belief state
조건 과거 token 현재 state와 action
기본 출력 다음 token 분포 다음 state·관찰·reward·value
시간 기록된 순서를 따라감 행동으로 분기하는 동역학
학습 데이터 문서·코드·대화·멀티모달 corpus 환경 trajectory, action과 결과
사용 방식 생성·질의응답·계획 제안 simulation·planning·control
대표 실패 그럴듯한 오류·문맥 불일치 model bias·장기 rollout 붕괴·물리 불일치

State는 미래를 예측하기 위한 충분한 현재입니다

State는 단순히 메모리에 저장된 값이나 모델의 hidden vector를 뜻하지 않습니다. 동역학과 강화학습에서 state는 현재부터 미래를 예측하는 데 필요한 과거의 충분한 요약입니다.

완전한 Markov state라면 전체 과거를 다시 보지 않아도 됩니다.

p(sₜ₊₁ | s≤ₜ, a≤ₜ) = p(sₜ₊₁ | sₜ, aₜ)

현재 state와 action만 알면 다음 state의 분포를 계산할 수 있다는 뜻입니다. 현실에서는 모든 변수를 관찰할 수 없으므로 세 종류를 구분해야 합니다.

  • 실제 환경 state: 물체의 위치와 속도, 온도, 사람의 의도처럼 세계에 실제로 존재하지만 일부는 보이지 않는 변수입니다.
  • Observation: 카메라 frame, 센서값, 문장처럼 agent가 지금 받은 측정값입니다.
  • Belief 또는 latent state: 제한된 observation과 과거 action으로 실제 state를 추정한 내부 표현입니다.

자율주행차의 카메라에서 앞차가 트럭 뒤로 가려졌다고 합시다. 현재 frame에는 앞차가 없습니다. 그러나 좋은 belief state는 앞차의 마지막 위치, 속도와 가림 상태를 유지해야 합니다. 몇 초 뒤 어디에서 나타날지 예측하려면 보이는 pixel만으로는 부족하기 때문입니다.

Token은 관찰을 나누는 단위입니다

Token은 tokenizer가 입력을 계산 가능한 조각으로 나눈 것입니다. 텍스트에서는 subword, 이미지에서는 patch, 로봇에서는 discretized action이 token이 될 수 있습니다. Token 자체에는 객체의 지속성이나 Markov property가 없습니다.

컵이 노트북 왼쪽에 있다는 문장을 token으로 나누면 , 노트북, 왼쪽에 해당하는 조각이 생깁니다. State는 이 조각을 넘어 두 객체의 identity와 위치 관계를 보존하고, 컵을 오른쪽으로 옮긴다는 action 이후 관계를 갱신해야 합니다.

Hidden activation은 state 후보이지 state라는 보장은 없습니다

Transformer의 각 layer는 문맥을 반영한 token별 hidden activation을 만듭니다. 일부 activation이 인물, 위치, 보드게임 상태 같은 정보를 담는다는 연구도 있습니다. 그러나 next-token loss는 이 표현이 일관된 객체 상태인지, action 이후 정확히 갱신되는지, 미래 예측에 충분한지를 직접 강제하지 않습니다.

문맥에 필요한 state가 암묵적으로 나타날 수는 있지만 다음 prompt에서 같은 구조로 유지될 보장은 없습니다. 인물의 나이, 공간 위치와 소유관계가 긴 생성 중에 흔들리는 이유도 이와 연결됩니다.

KV cache는 세계 state가 아닙니다

KV cache는 과거 token의 attention key와 value를 다시 계산하지 않기 위한 computational memo입니다. 과거 전체를 압축한 고정 크기 state가 아니라 sequence 길이에 따라 계속 커지는 저장소입니다. 과거 token의 표현을 읽을 수는 있지만 이미 저장된 cache를 현실의 변화에 맞춰 다시 쓰지는 않습니다.

반면 recurrent world model이나 state-space model은 새 observation과 action이 들어올 때 state를 갱신합니다.

stateₜ₊₁ = update(stateₜ, observationₜ₊₁, actionₜ)

고정 크기 state는 오래된 세부사항을 잃을 수 있고 KV cache는 비용이 계속 커집니다. 어느 쪽도 절대적으로 우월하지 않습니다. 긴 원문을 그대로 다시 읽어야 하는 언어 과제에는 context와 cache가 유리하고, 변화하는 환경을 계속 추적해야 하는 control 과제에는 갱신 가능한 state가 중요합니다.

Token은 입력 단위이고, State는 세계를 예측하기 위한 요약입니다Token·context· 관찰과 기록의 조각· sequence 순서로 저장· Markov 성질 없음· 과거를 직접 다시 읽음Hidden·KV cache· 문맥화된 계산 표현· 다음 token 계산 재사용· state를 암묵적으로 포함 가능· 일관된 전이 보장은 없음Belief·latent state· 숨은 세계에 대한 가설· action으로 변화· 미래·reward 예측에 최적화· 관찰로 계속 수정관찰을 압축하고 해석State의 충분성은 목적에 따라 달라집니다체스에서는 말의 위치와 차례가 중요하고, 자율주행에서는 위치·속도·가림·의도가 필요합니다.세상의 모든 세부사항이 아니라 다음 행동의 결과를 예측하는 데 필요한 정보가 state입니다.표현 형식만으로 구분할 수 없습니다State도 token으로 이산화할 수 있고 token 집합이 state를 표현할 수도 있습니다.차이는 데이터형이 아니라 예측의 충분성, 지속성, action-conditioned update라는 역할입니다.
Token과 state는 서로 배타적인 데이터형이 아닙니다. Tokenized state도 가능합니다. 핵심은 그 표현이 행동 이후의 미래를 예측하는 충분한 요약으로 학습됐는지입니다.

다음 Token 예측은 인과관계를 식별하지 않습니다

언어모델이 인과관계를 전혀 모른다는 주장은 과도합니다. 학습 문서에는 흡연이 폐암 위험을 높인다, 금리를 올리면 수요가 둔화될 수 있다 같은 인과적 문장이 많습니다. 모델은 이 지식을 기억하고 새로운 문제에 유추할 수 있습니다. 명시적인 causal graph와 숫자를 주면 intervention 계산을 수행하기도 합니다. LLM의 개입 추론 평가 연구에서도 일부 모델은 제한된 causal graph에서 유의미한 성능을 보였습니다.

부족한 것은 인과 지식의 존재가 아니라 그 답이 관찰된 상관관계가 아니라 실제 생성 메커니즘에서 나왔다는 보장입니다.

관찰은 함께 움직인다는 사실만 줍니다

비가 오는 날에는 우산을 든 사람과 젖은 도로가 함께 많이 등장합니다. 언어모델은 우산젖은 도로의 높은 통계적 연관성을 배울 수 있습니다. 그러나 관찰만으로 다음 세 구조를 항상 구분할 수 있는 것은 아닙니다.

  • 우산이 도로를 젖게 했습니다.
  • 젖은 도로가 사람에게 우산을 들게 했습니다.
  • 비가 우산과 젖은 도로의 공통 원인입니다.

서로 다른 causal graph가 같은 observational distribution을 만들 수 있습니다. 이를 Markov equivalence라고 합니다. 추가 가정, 시간 정보, 자연실험 또는 intervention이 없으면 데이터가 아무리 많아도 방향을 식별하지 못하는 경우가 있습니다. Towards Causal Representation Learning이 지적하는 핵심도 저수준 관찰에서 실제 causal variable과 독립적인 생성 메커니즘을 발견하는 일이 어렵다는 점입니다.

P(Y|X)P(Y|do(X))는 다른 질문입니다

관찰 예측은 X가 관찰됐을 때 Y가 얼마나 자주 나타나는가를 묻습니다.

P(Y | X)

인과 추론은 다른 조건을 유지하고 X를 강제로 바꿨을 때 Y가 어떻게 달라지는가를 묻습니다.

P(Y | do(X))

의사의 판단으로 약을 투여받은 환자와 투여받지 않은 환자를 비교하는 것은 관찰입니다. 중증 환자에게 약이 더 많이 처방됐다면 약을 먹은 집단의 결과가 오히려 나빠 보일 수 있습니다. 무작위 배정, 도구변수, 차분의 차분처럼 treatment assignment의 편향을 통제해야 약의 효과에 접근할 수 있습니다.

LLM의 pre-training corpus는 누가 어떤 환경에서 왜 문장을 썼는지까지 완전하게 기록하지 않습니다. 성공 사례는 많이 출판되고 실패는 사라질 수 있으며, 사회적 편견과 선택 편향도 들어갑니다. 다음 token을 정확히 예측해도 이 data-generating process를 자동 복원할 수는 없습니다.

Causal mask의 causal은 인과 추론이 아닙니다

Decoder Transformer의 attention mask를 causal mask라고 부릅니다. 현재 token이 미래 token을 미리 보지 못하게 막기 때문입니다. 이는 정보가 시간 순서를 거슬러 새는 것을 막는 계산 규칙입니다.

미래 token을 보지 않는다원인에서 결과로만 추론한다는 전혀 다릅니다. 문장에서는 결과가 먼저 나오고 원인이 나중에 설명될 수 있습니다. Attention weight가 높다는 것도 해당 token이 결과의 원인이라는 뜻이 아닙니다. Attention은 예측에 사용된 통계적 관련도이지 intervention의 효과가 아닙니다.

Counterfactual은 관찰되지 않은 세계를 요구합니다

가격을 올렸더라면 매출이 어땠을까라는 질문에는 현실에서 동시에 관찰할 수 없는 두 세계가 있습니다. 실제 가격을 유지한 세계와 가격을 올린 세계입니다. 한 고객, 한 시점에서 둘을 모두 관찰할 수 없으므로 causal model은 구조적 가정과 비교 가능한 집단을 이용해야 합니다.

LLM은 과거 문장에서 비슷한 counterfactual 답변을 생성할 수 있지만, 동일한 hidden state에서 두 intervention만 바꾼 일관된 twin world를 유지하도록 기본 설계돼 있지 않습니다. 그럴듯한 설명과 식별된 causal effect는 다릅니다.

인과관계를 위한 아키텍처는 변수·전이·개입을 분리합니다

인과성은 neural network block 하나를 추가한다고 생기지 않습니다. 어떤 변수를 state로 표현하고, 어떤 data를 수집하며, 어떤 intervention과 invariant mechanism을 학습할지가 함께 설계돼야 합니다.

1. 객체와 causal variable을 분리합니다

일반적인 latent vector는 장면 전체의 정보를 얽힌 형태로 저장할 수 있습니다. 배경색, 물체 위치와 카메라 각도가 한 좌표에 섞이면 무엇을 바꿨을 때 어떤 결과가 생겼는지 추적하기 어렵습니다.

Object-centric representation은 사람, 컵, 차량 같은 entity를 slot으로 나누고 위치, 속도, 속성을 별도로 표현하려 합니다. 인과 표현학습은 여기서 더 나아가 서로 독립적으로 변하는 생성 요인을 찾습니다. 좋은 variable을 찾지 못하면 정확한 causal equation도 세울 수 없습니다.

2. Structural Causal Model로 메커니즘을 모듈화합니다

Structural Causal Model은 각 변수의 값을 부모 변수와 독립 noise의 함수로 표현합니다.

Xᵢ = fᵢ(Parents(Xᵢ), Uᵢ)

do(X=k)는 X를 만들던 기존 방정식을 끊고 값을 k로 고정합니다. 나머지 mechanism은 유지합니다. 모든 관계를 하나의 거대한 network에 암묵적으로 넣는 대신, 어떤 module이 어떤 variable을 생성하는지 분리하므로 intervention과 transfer를 표현하기 쉬워집니다.

3. Action-conditioned dynamics를 학습합니다

World model은 agent의 action을 transition model의 명시적 입력으로 받습니다.

sₜ₊₁ = f(sₜ, aₜ, εₜ)

같은 state에서 다른 action을 실행한 trajectory가 충분히 있다면 action이 outcome을 어떻게 바꾸는지 학습할 수 있습니다. 그러나 action-conditioned model 자체가 causal하다는 뜻은 아닙니다. 과거 policy가 특정 상태에서 특정 action만 골랐다면 action과 숨은 위험요인이 여전히 얽혀 있을 수 있습니다.

4. Agent가 능동적으로 실험합니다

관찰만 받는 모델은 데이터에 없는 intervention을 만들 수 없습니다. Agent는 불확실한 causal direction을 구분하는 action을 선택할 수 있습니다. 로봇이 물체를 밀어보고, 과학 agent가 실험조건을 바꾸고, 소프트웨어 agent가 A/B test를 제안하는 방식입니다.

좋은 active experiment는 즉시 보상을 많이 주는 행동과 다를 수 있습니다. 여러 causal hypothesis를 가장 잘 구분해 주는 행동을 골라야 합니다. 따라서 planner의 목적함수에 보상뿐 아니라 information gain이 들어갑니다.

5. 대안 세계를 분기해 일관성을 검사합니다

동일한 state에서 action A와 B를 각각 rollout하면 counterfactual trajectory를 비교할 수 있습니다. Genie 2도 같은 시작 frame에서 서로 다른 action에 따라 다양한 trajectory를 생성합니다.

하지만 generated counterfactual은 현실의 증거가 아니라 학습된 model의 믿음입니다. World model이 물리를 잘못 배웠다면 두 trajectory 모두 그럴듯하게 틀릴 수 있습니다. 실제 intervention 결과와 비교해 model bias를 교정해야 합니다.

6. 환경이 바뀌어도 유지되는 mechanism을 찾습니다

단순 correlation은 배경, 지역과 정책이 달라지면 쉽게 깨집니다. Causal mechanism은 환경이 달라져도 상대적으로 안정적이라는 가정을 이용할 수 있습니다. 여러 환경에서 동일하게 유지되는 관계를 찾고, 변하는 관계는 context variable이나 policy의 영향으로 분리합니다.

7. Belief state와 uncertainty를 유지합니다

부분 관찰 환경에서 state를 하나의 확정 벡터로 두면 잘못된 가정을 사실처럼 굳힐 수 있습니다. 가능한 여러 state의 분포, 즉 belief를 유지하고 새 observation이 들어올 때 Bayesian update 또는 learned filtering으로 수정해야 합니다.

인과 추론에서도 하나의 graph만 확정하기보다 관찰로 구분되지 않는 graph와 effect의 범위를 유지해야 합니다. 잘 모르는 상태를 표현하지 못하면 agent는 추가로 관찰할지, 실험할지, 사람에게 물을지 결정할 수 없습니다.

월드모델도 자동으로 인과모델이 되지는 않습니다

비디오를 매우 정확하게 생성하는 model은 물체가 어떻게 움직이는지 학습했을 가능성이 큽니다. 그러나 예측 정확도만으로 causal understanding을 증명할 수는 없습니다.

  • 카메라가 오른쪽으로 움직인 것과 물체가 왼쪽으로 움직인 것을 혼동할 수 있습니다.
  • 사람이 문을 열기 전에 손잡이를 잡는 correlation을 보았지만 문 mechanism을 이해하지 못할 수 있습니다.
  • 학습영상에서 드문 충돌, 고장과 극단조건을 부정확하게 생성할 수 있습니다.
  • 긴 rollout에서 작은 state 오류가 누적돼 현실에 없는 세계로 drift할 수 있습니다.
  • 모델이 만든 counterfactual은 자기 믿음을 반복 검증하는 closed loop가 될 수 있습니다.

월드모델이 causal model에 가까워지려면 action intervention, 여러 환경, object permanence, mechanism 변화와 실제 결과의 feedback이 필요합니다. 구조는 필요한 조건이지만 충분조건은 아닙니다.

미래 시스템은 LLM과 월드모델을 결합할 가능성이 큽니다

언어모델과 월드모델은 서로 대체하기보다 역할이 다릅니다.

  • LLM: 목표를 언어로 이해하고, 지식과 규칙을 불러오며, 계획 후보와 설명을 만듭니다.
  • Perception model: 이미지, 음성, 센서에서 객체와 사건을 추출합니다.
  • State estimator: 현재 세계와 불확실성을 belief state로 유지합니다.
  • World model: action-conditioned transition과 reward를 예측합니다.
  • Causal model: intervention, confounding과 mechanism 변화를 표현합니다.
  • Planner: 여러 future trajectory를 비교해 action을 고릅니다.
  • Tool·environment: 실제 action을 실행하고 결과를 반환합니다.
  • Verifier·human: 안전, 목표와 현실의 결과를 확인합니다.
언어, 상태, 동역학, 인과는 하나의 닫힌 시스템에서 만납니다사용자 목표·규칙언어·제약·가치LLM planner의미·지식·계획 후보Causal planner개입 후보·정보가치·안전 제약World model rolloutp(sₜ₊₁, rₜ | sₜ, aₜ)Belief state객체·관계·불확실성Perception관찰 → 객체·사건환경·도구·로봇·실험실선택한 action을 현실에서 실행하고 새 observation·reward·failure를 반환Verifier·human예측과 현실의 차이·권한·안전·목표 달성 검증
LLM이 모든 역할을 내부적으로 흉내 내게 하는 대신, 각 모듈이 잘하는 표현과 검증을 맡습니다. 현실의 결과가 다시 perception과 state update로 들어와야 loop가 닫힙니다.

이 결합에서 LLM은 사라지지 않습니다. 오히려 구조화되지 않은 목표와 방대한 배경지식을 다루는 가장 강한 semantic interface가 됩니다. 다만 LLM의 문장을 현실 state로 착각하지 않고, 별도의 state tracker와 dynamics model, causal estimator가 검증해야 합니다.

코딩 agent에서도 비슷한 구조가 이미 나타납니다. LLM은 수정계획과 patch를 만들지만 실제 repository state는 filesystem과 Git이 보유합니다. Test runner가 action의 결과를 결정적으로 평가하고, 실패 trace가 다음 state update에 들어갑니다. 언어모델 혼자 머릿속으로 codebase를 상상할 때보다 외부 state와 evaluator를 연결할 때 신뢰성이 높아집니다.

인과적 지능은 별도의 평가가 필요합니다

언어 benchmark와 video generation 품질만으로 state와 causal understanding을 평가하기 어렵습니다. 다음 능력을 분리해 측정해야 합니다.

평가 대상 확인할 질문
State tracking 가려진 객체, 소유관계와 수량을 장기간 일관되게 유지하는가
Transition accuracy 동일 state와 action에서 다음 state 분포가 실제와 맞는가
Intervention do(X) 이후 관련 variable만 올바르게 변하는가
Confounding 공통 원인과 selection bias를 구분하는가
Counterfactual 같은 과거에서 action 하나만 바꾼 대안 세계가 일관적인가
Invariance 배경과 환경이 바뀌어도 mechanism을 유지하는가
Calibration 모르는 state와 causal direction에 낮은 confidence를 주는가
Active experiment 불확실성을 가장 많이 줄이는 실험을 선택하는가
Long rollout 여러 단계 뒤에도 물리·규칙·identity가 무너지지 않는가
Reality correction 예측이 틀렸을 때 실제 관찰로 model과 belief를 수정하는가

텍스트에서 causal 문장을 잘 완성하는 것과 intervention effect를 맞히는 것은 별도 평가입니다. 영상을 선명하게 생성하는 것과 object permanence 및 action dynamics를 유지하는 것도 별도 평가입니다. 평균적인 next-step prediction이 좋아져도 드문 intervention과 장기 planning에서는 실패할 수 있습니다.

모델의 다음 경쟁은 Token보다 State에 가깝습니다

초기 Transformer가 해결한 문제는 긴 sequence 안에서 멀리 떨어진 정보의 관계를 병렬로 계산하는 것이었습니다. 현재 프런티어 LLM은 그 구조를 초대형 데이터, MoE, 장문맥과 멀티모달로 확장했습니다. 이 발전만으로도 언어와 코드에서는 놀라운 범용성이 나왔습니다.

그러나 현실에서 지속적으로 행동하려면 다음 token만으로 부족합니다. 지금 무엇이 존재하는지, 보이지 않는 것은 어디에 있을 가능성이 높은지, 어떤 action이 어떤 state transition을 일으키는지, 무엇을 모르는지 유지해야 합니다. 이것이 state의 역할입니다.

인과관계는 state보다 한 단계 더 어렵습니다. 다음에 무엇이 일어날지 예측하는 것뿐 아니라, 다른 action을 했을 때 무엇이 달라질지, 관찰된 correlation이 공통 원인 때문인지, 어떤 mechanism이 환경 변화에도 유지되는지를 알아야 합니다. 이를 위해서는 구조화된 variable, action-conditioned dynamics, intervention과 reality feedback이 필요합니다.

현재 프런티어 LLM이 2017년 Transformer와 달라진 가장 큰 지점은 backbone만이 아닙니다. Model이 system으로 확장됐다는 점입니다. 앞으로의 변화도 새로운 attention 하나보다 언어모델, state estimator, world model, causal model, planner와 environment를 어떤 loop로 연결하는가에서 나올 가능성이 큽니다.

맺으며

Token은 세계 그 자체가 아닙니다. 사람이 남긴 문장, 카메라 frame과 sensor reading을 잘게 나눈 기록입니다. Hidden activation은 그 기록을 문맥화한 계산이고, KV cache는 과거 계산을 다시 쓰기 위한 저장소입니다.

State는 다른 역할을 합니다. 현재 보이는 것과 과거의 action을 이용해 세계가 지금 어떤 상태일지 세운 가설이며, 다음 action의 결과를 예측할 수 있어야 합니다. Causal model은 그 state에서 variable 하나를 개입했을 때 어떤 mechanism을 따라 결과가 바뀌는지 묻습니다.

따라서 LLM과 월드모델의 차이는 언어와 영상의 차이도, Transformer와 다른 network의 차이도 아닙니다. 기록의 다음 조각을 예측하는가, 행동 가능한 세계의 상태와 전이를 유지하는가의 차이입니다. 인과적 AI로 가는 길은 더 많은 token을 읽히는 것에서 끝나지 않습니다. 세계에 action을 가하고, 결과를 관찰하며, 틀린 state와 mechanism을 수정할 수 있는 닫힌 학습 loop가 필요합니다.


주요 출처

YS-VC | Founder Intake Desk — Intervest