← Back to list

535B 모델이 자라는 과정이 열렸습니다, Marin 공개 학습을 읽는 법

MarinMoELLM 학습스케일링 법칙오픈소스 AIW&BGB200 NVL72

완성된 언어모델은 많이 공개됩니다. 다운로드할 수 있는 가중치와 벤치마크 점수도 빠르게 늘고 있습니다. 하지만 그 모델이 어떤 데이터를 먹었고, 어떤 설정으로 학습했으며, 중간에 무엇이 흔들렸고, 연구진이 왜 설정을 바꿨는지까지 공개되는 경우는 드뭅니다.

2026년 8월, 스탠퍼드대학교에서 시작된 오픈 연구 프로젝트 Marin이 대규모 학습의 내부를 열었습니다. Marin은 총 5,353억 개 파라미터를 가진 희소 혼합전문가 모델 535B-A23B의 학습을 시작했습니다. 실행 계획과 기술 기록은 GitHub에, 학습 지표는 Weights & Biases에 공개되어 있습니다. 데이터 구성도 별도의 대화형 페이지에서 확인할 수 있습니다.

이 프로젝트가 당장 최고 성능 모델의 탄생을 의미하지는 않습니다. 아직 사전학습 초반이고, 긴 문맥 확장과 후반 데이터 학습, 지시학습과 강화학습도 남아 있습니다. 지금 공개된 것은 우승자의 성적표가 아니라 대규모 모델이 만들어지는 연구실의 계기판과 운항일지입니다.

핵심 의미
Marin이 연 것은 모델 파일 하나가 아닙니다. 데이터 선택, 작은 규모의 예행학습, 성능 예측, 실제 학습 곡선, 장애와 수정 기록을 서로 연결해 검증할 수 있는 공개 제작 과정입니다.

숫자부터 사람의 언어로 바꾸면

공개 실행 기록에 적힌 주요 설정은 다음과 같습니다.

항목 공개 설정 쉬운 의미
전체 파라미터 535.3B 모델 전체에 저장된 조정 가능한 숫자가 약 5,353억 개
토큰당 활성 파라미터 22.76B 한 토큰을 처리할 때 실제로 동원되는 부분은 약 228억 개
구조 384 experts, top-8, shared experts 2개 384개 전문 부서 중 8개를 골라 쓰고, 공통 부서 2개도 항상 사용
층수와 기본 문맥 48개 층, 4,096 tokens 처음에는 비교적 짧은 문맥으로 안정성과 전문가 배분을 우선 점검
하드웨어 GB200 NVL72 11개 랙 랙 내부의 빠른 연결과 랙 사이 네트워크를 함께 쓰는 대형 분산학습
학습 설정의 토큰 수 18.0T 현재 실행 설정상 약 18조 토큰, 390,139 스텝
데이터 계획의 기준량 18.75T 발표와 데이터 레시피에서 쓰는 15T + 3.75T 기준량
계획 연산량 약 2.70×10²⁴ FLOPs 순전파와 역전파를 합친 분석상 연산 예산
예상 기간 약 100일 하드웨어·통신·중단 시간에 따라 달라질 수 있는 계획

여기에는 먼저 짚어야 할 표기 차이가 있습니다. 퍼시 량 교수의 발표와 데이터 계획은 18.75조 토큰을 말하지만, 현재 GitHub 실행 요약과 학습 설정은 총 18.0조 토큰으로 적혀 있습니다. 설정의 배치 크기와 스텝 수를 곱해도 약 18.0조 토큰이 나옵니다. 공개 기록은 15조 토큰의 첫 단계와 3.75조 토큰의 후반 데이터 기준도 함께 사용합니다.

따라서 이를 하나의 확정 숫자로 뭉개기보다 실제 훈련 실행은 18.0T, 데이터 혼합과 발표의 기준량은 18.75T로 표기되어 있다고 읽는 편이 정확합니다. 앞으로 설정이 갱신되면 이 차이도 설명될 수 있습니다. 공개 학습의 장점은 이런 불일치까지 밖에서 발견하고 질문할 수 있다는 데 있습니다.

Marin 535B-A23B의 희소 혼합전문가 구조와 학습 하드웨어총 535.3B 파라미터 중 라우터가 토큰마다 384개 전문가 가운데 8개를 선택하고 공통 전문가와 어텐션을 더해 22.76B 파라미터를 활성화하며, 11개 GB200 NVL72 랙에서 학습하는 구조535B 전체를 매번 쓰지 않습니다큰 전문 도서관을 갖되, 질문마다 필요한 서가만 여는 구조입니다전체 모델535.3B384개 전문 부서48개 Transformer 층라우터가 선택토큰마다 top-8 + 공통 2개토큰당 실제 계산22.76B큰 저장 용량과상대적으로 작은 활성 계산11 × GB200 NVL72 랙랙 안: 64-way expert parallel로 전문가 계산을 빠르게 교환랙 사이: 같은 모델 복제본이 서로 다른 데이터 묶음을 학습하고 결과를 합침… 11개
535B-A23B의 뜻. 전체 파라미터 수는 모델이 보유한 총 용량이고, 활성 파라미터 수는 토큰 하나를 처리할 때 동원되는 계산 경로입니다. 도식은 Marin의 공개 설정을 단순화해 재구성했습니다.

535B와 A23B는 서로 다른 숫자입니다

일반적인 밀집 모델은 입력이 들어올 때 대부분의 파라미터를 매번 사용합니다. 혼합전문가(Mixture of Experts, MoE) 모델은 다릅니다. 여러 전문가 모듈을 만들어두고, 라우터가 입력 토큰마다 필요한 전문가만 선택합니다.

Marin 모델은 각 층에서 384개의 라우팅 전문가 가운데 8개를 고릅니다. 여기에 항상 작동하는 두 개의 공통 전문가와 어텐션 같은 공통 부분이 더해집니다. 그래서 전체 파라미터는 535.3B지만 토큰당 활성 파라미터는 22.76B입니다.

회사에 비유하면 535B는 전체 직원과 지식창고의 규모이고, A23B는 한 사건을 처리하기 위해 실제 회의에 들어오는 인원입니다. 법률 문장은 법률에 익숙한 부서로, 코드는 코드 패턴에 익숙한 부서로 보내는 식의 전문화가 가능해집니다.

다만 “535B의 지식과 23B의 비용을 동시에 얻는다”는 문장은 절반만 맞습니다. 선택된 전문가의 계산량은 줄일 수 있지만, 5,353억 개 파라미터를 저장하고 여러 장비에 나누며 전문가 사이에 토큰을 보내는 통신 비용은 남습니다. 전문가 몇 곳에 요청이 몰리면 일부 토큰을 제때 처리하지 못하는 문제도 생깁니다. MoE의 난점은 큰 모델을 만드는 일뿐 아니라 전문가에게 일을 고르게 나누고 빠르게 전달하는 일입니다.

Switch Transformer 연구부터 알려진 MoE의 장점과 위험이 바로 여기에 있습니다. 희소 활성화는 계산량 증가를 억제하면서 모델의 총 용량을 키울 수 있지만, 라우팅과 통신, 학습 안정성이 새로운 병목이 됩니다.

11개의 랙은 거대한 컴퓨터 한 대처럼 움직여야 합니다

엔비디아의 공식 사양에 따르면 GB200 NVL72 한 랙은 72개의 Blackwell GPU와 36개의 Grace CPU를 묶은 랙 규모 시스템입니다. Marin의 공개 토폴로지는 각 랙 안에서 64-way expert parallel을 사용하고, 11개 랙을 데이터 병렬 복제본으로 연결합니다.

여기서 중요한 것은 GPU 개수보다 연결 방식입니다.

  • 랙 안에서는 전문가 병렬화가 작동합니다. 한 토큰이 선택한 여러 전문가가 서로 다른 GPU에 있으므로 중간 계산값을 빠르게 주고받아야 합니다.
  • 랙 사이에서는 데이터 병렬화가 작동합니다. 각 랙이 서로 다른 문장 묶음을 처리한 뒤 학습 결과를 합칩니다.
  • 느린 연결 하나가 전체를 기다리게 할 수 있습니다. 수백 개 장비가 동시에 한 걸음을 내딛는 작업이라 가장 느린 통신, 체크포인트 저장, 장애 복구가 실제 속도를 좌우합니다.

그래서 대규모 모델 학습은 단순히 GPU를 많이 꽂는 일이 아닙니다. 데이터 파이프라인, 모델 구조, GPU 커널, 메모리 사용, 랙 내부 통신, 랙 간 네트워크, 장애 복구가 동시에 맞아야 합니다. Marin 이슈에 모델 코드뿐 아니라 자체 expert-parallel 구현, 메모리 오프로딩, 체크포인트 수정과 처리효율 기록이 길게 적힌 이유입니다.

작은 모델 네 개는 본 학습의 풍동 실험입니다

비행기를 바로 실물 크기로 만들어 하늘에 띄우지 않듯이, Marin은 535B 모델을 시작하기 전에 같은 설계를 작은 크기로 반복했습니다. 이를 스케일링 래더(scaling ladder)라고 부릅니다.

단계 전체 파라미터 활성 파라미터 학습 토큰 상태
d768 1.6B 61M 48B 완료
d1024 4.0B 162M 128B 완료
d1536 11.5B 481M 381B 완료
d2048 27.7B 1.2B 926B 약 81%에서 중단
d6144 hero 535.3B 22.76B 실행 설정 18.0T 진행 중

작은 모델은 단순한 연습문제가 아닙니다. 네 모델에서 크기와 연산량이 늘 때 손실이 어떤 규칙으로 낮아지는지를 측정하면, 535B 모델이 학습 5%, 10%, 50%, 100% 지점에서 어느 정도 손실에 도달해야 하는지 미리 예측할 수 있습니다.

Marin이 사용한 스케일링 래더의 비용은 본 학습 연산량의 약 1%입니다. 이 1%로 다음을 얻습니다.

  1. 데이터나 모델 구현에 큰 문제가 없는지 본 학습 전에 확인합니다.
  2. 기울기 크기와 전문가 토큰 누락이 규모에 따라 어떻게 변하는지 봅니다.
  3. 본 학습의 중간 체크포인트가 예상 경로 위에 있는지 비교할 기준선을 만듭니다.
  4. 이상 현상이 보일 때 작은 모델에서도 나타난 정상 패턴인지 구분합니다.

실제로 Marin의 이전 스케일링 래더는 학습이 길어질수록 기울기가 커지는 현상을 발견했습니다. 연구진은 이를 추적해 출력 로짓이 지나치게 커지는 것을 억제하는 z-loss를 추가했습니다. 후속 실험에서는 이 장치가 없을 때 큰 배치 조건의 학습이 중간에 무너질 수 있음을 확인했습니다. 작은 모델의 손실 곡선은 예쁜 예측 그래프가 아니라 수개월짜리 실패를 싸게 막는 보험입니다.

이번 래더가 예측한 최종 dropless Paloma macro loss는 약 2.04입니다. 그러나 조건이 붙습니다. 4K 문맥과 같은 데이터 혼합을 끝까지 유지한다는 가상 시나리오의 예측입니다. 실제 본 학습은 문맥 길이를 늘리고 데이터 혼합도 바꿀 계획입니다. 가장 큰 d2048 예행학습도 81%에서 중단되어 마지막 구간은 외삽했습니다. 따라서 2.04는 약속된 종착점이 아니라 초반 운항 경로가 정상인지 확인하는 기준선입니다.

loss는 시험 점수가 아니라 다음 토큰의 놀람 정도입니다

W&B에서 가장 먼저 눈에 들어오는 선은 loss입니다. 대체로 내려가므로 모델의 실력이 오르는 점수처럼 보이지만 정확한 뜻은 다릅니다.

언어모델은 앞의 문장을 보고 다음 토큰을 예측합니다. 정답 토큰에 낮은 확률을 줬다면 크게 벌점을 받고, 높은 확률을 줬다면 작은 벌점을 받습니다. 이 벌점의 평균이 loss입니다. 낮아진다는 것은 훈련 데이터의 패턴을 더 잘 예측한다는 뜻입니다.

다음 세 가지를 함께 기억해야 합니다.

  • 작은 출렁임은 정상입니다. 매 스텝마다 다른 문장 묶음을 보므로 선은 톱니처럼 흔들립니다. 한 점보다 이동 방향을 봐야 합니다.
  • 갑작스러운 꺾임이 모두 사고는 아닙니다. 데이터 혼합이나 문맥 길이를 바꾸면 문제의 난도가 달라져 loss가 순간적으로 뛸 수 있습니다.
  • 다른 모델의 loss와 숫자만 비교하면 안 됩니다. 토크나이저, 데이터, 평가셋, 문맥 길이가 다르면 같은 2.0도 같은 의미가 아닙니다.

훈련 loss만 낮고 보지 않은 검증 데이터의 loss가 개선되지 않는다면 외우기만 했을 수 있습니다. 그래서 Marin은 실제 라우팅에서 발생하는 누락을 제거한 dropless 평가 loss, Paloma와 별도 검증 묶음의 지표를 함께 기록합니다. 비전공자가 한 개만 고른다면 훈련 loss의 절댓값보다 같은 평가 지표가 예측 경로를 따라 꾸준히 내려가는지를 보는 편이 낫습니다.

Marin 공개 학습 대시보드에서 볼 다섯 가지 신호예측 대비 평가 손실, 기울기 방향, 전문가 토큰 누락, 라우터 균형, 처리효율을 함께 보고 학습 초반과 기울기 정점, 문맥 확장, 데이터 전환 구간을 구분하는 관찰 지도loss 한 줄보다 다섯 계기판을 함께 봅니다평가 loss예측선과 방향 비교기울기크기보다 변화율토큰 누락전문가 과부하 확인라우터 균형전문가 쏠림 확인처리효율MFU·속도·중단예정된 변곡점과 사고를 구분하는 시간표0~3%워밍업약 25~30%기울기 정점 예상약 50%4K→8K 문맥약 80%후반 데이터 전환약 95%장문맥 확장경고 신호: 여러 계기판이 동시에 예측 경로에서 벗어나고 복귀하지 않을 때한 번의 loss 상승이나 짧은 처리속도 저하만으로 실패를 선언하지 않습니다
W&B 관찰 지도. 구체적인 문맥 확장 시점과 데이터 혼합은 시스템 개발 상황에 따라 바뀔 수 있으므로 GitHub 이슈의 최신 설명을 함께 봐야 합니다.

기울기는 모델이 얼마나 세게 흔들리는지 보여줍니다

학습은 정답과 예측의 차이를 계산하고, 그 차이를 줄이는 방향으로 파라미터를 조금씩 움직이는 과정입니다. 이때 어느 방향으로 얼마나 움직일지를 나타내는 신호가 gradient, 즉 기울기입니다. gradient norm은 수많은 기울기를 하나의 크기로 요약한 값입니다.

너무 작으면 학습이 멈춘 듯 느려질 수 있고, 갑자기 계속 커지면 파라미터가 통제되지 않는 방향으로 튈 수 있습니다. 하지만 절댓값만 보고 정상과 비정상을 정할 수는 없습니다. Marin은 MuonH와 Hyperball 제약이라는 특수한 최적화 방식을 사용하므로 일반적인 AdamW 학습의 숫자와 바로 비교할 수 없습니다.

연구진이 제시한 예상 패턴은 더 유용합니다. 작은 모델에서는 gradient norm이 학습 초반에 올라가 약 25% 부근에서 정점을 찍은 뒤 학습률 감소와 함께 내려왔습니다. 본 학습도 약 25~30% 구간에서 비슷한 전환이 예상됩니다. 높아지는 것 자체보다 예상 정점을 지나서도 증가 속도가 줄지 않는지가 중요한 신호입니다.

token dropping은 전문가 부서의 미처리 업무입니다

MoE 모델의 라우터가 특정 전문가에게 너무 많은 토큰을 보내면 그 전문가의 처리 공간이 넘칠 수 있습니다. 정해진 용량 안에 들어오지 못한 요청은 이번 계산에서 빠집니다. 이것이 token dropping입니다.

쉽게 말해 384개 전문 창구가 있는데 몇몇 창구에만 고객이 몰려 접수를 놓치는 상황입니다. 누락률이 지속적으로 높으면 해당 토큰은 일부 전문가 계산을 충분히 받지 못하고, 유료 GPU도 고르게 쓰이지 않습니다.

Marin의 작은 모델 실험에서는 4K 문맥에서 누락률이 학습 초기에 움직인 뒤 대체로 몇 퍼센트 수준으로 형성됐습니다. 연구진은 본 학습이 약 2% 부근에서 움직일 가능성을 가장 높게 보면서도 8%까지 가능하다고 적었습니다. 더 긴 65K 문맥의 이전 시험에서는 누락이 크게 높아졌기 때문에 문맥 확장은 이번 학습의 중요한 위험 구간입니다.

관찰할 것은 0%라는 완벽한 숫자가 아닙니다. 작은 모델의 패턴과 비슷한지, 문맥을 늘릴 때 얼마나 뛰는지, 높은 수준이 지속되는지, 특정 전문가로 트래픽이 쏠리는지를 함께 봐야 합니다.

router entropy는 384개 전문가가 골고루 일하는지 보여줍니다

라우터 엔트로피는 전문가 선택이 얼마나 퍼져 있는지를 요약합니다. 몇 개 전문가만 반복해서 선택되면 낮아지고, 여러 전문가가 고르게 선택되면 높아집니다.

384개 전문가가 완전히 균등하게 선택될 때의 이론적 엔트로피는 자연로그 기준 약 5.95입니다. W&B의 초기 공개 요약에서는 여러 층의 라우팅 엔트로피가 대체로 이 값에 가깝게 기록됐습니다. 이는 적어도 해당 시점에 전문가 사용이 극단적으로 몇 곳에만 몰리지 않았다는 신호입니다. 다만 고른 배분이 곧 좋은 전문화를 뜻하지는 않습니다. 모델이 실제로 서로 다른 전문가에게 서로 다른 능력을 학습시키는지는 별도의 분석이 필요합니다.

MFU는 비싼 장비가 계산에 쓴 시간의 비율입니다

Model FLOPs Utilization(MFU)은 하드웨어의 이론적 연산 능력 가운데 모델 계산에 실제로 활용된 몫을 추정합니다. 나머지 시간에는 통신을 기다리거나 데이터를 불러오고, 메모리를 옮기고, 체크포인트를 저장하고, 장비 간 속도를 맞추는 일이 포함됩니다.

MFU가 높을수록 무조건 좋은 모델이 되는 것은 아닙니다. 같은 모델과 같은 정확도를 더 적은 시간과 비용으로 학습한다는 운영 효율의 지표입니다. 이 프로젝트에서는 절댓값보다 시간이 지나도 처리량과 MFU가 유지되는지, 특정 시점에 급락했다면 GitHub 기록에 하드웨어 장애나 통신 병목 설명이 남는지를 보는 편이 좋습니다.

작은 d2048 실행 기록은 계산이 진행되는 순간과 실제 지속 처리량 사이에 차이가 있었고, 연구진은 랙 사이 네트워크의 간헐적 통신을 주요 원인으로 적었습니다. 이런 정보는 완성 모델의 벤치마크 표에서는 사라집니다. 공개 대시보드는 대규모 AI의 성능이 알고리즘뿐 아니라 시스템 운영에서 결정된다는 사실을 보여줍니다.

현재는 전체 여정의 약 2% 지점입니다

W&B가 공개한 요약 파일의 마지막 갱신 시각인 2026년 8월 23일 오전 7시 44분 KST 기준, 본 학습은 390,139 스텝 가운데 7,636 스텝을 기록했습니다. 약 1.96%입니다.

한 스텝은 11,264개의 4,096토큰 시퀀스를 처리합니다. 이를 곱하면 스텝당 약 4,614만 토큰이고, 7,636 스텝까지 약 3,523억 토큰을 처리한 셈입니다. 수치는 계속 바뀌며 대시보드 전송에도 지연이 생길 수 있습니다.

이 시점은 첫 3% 위험 구간 안입니다. 학습률 워밍업을 지나 안정적인 움직임에 들어가는지, 기울기가 통제되는지, 토큰 누락이 작은 모델의 범위에서 움직이는지가 우선입니다. 지금 보이는 loss만으로 최종 능력을 예측하거나 다른 완성 모델과 순위를 비교하기에는 너무 이릅니다.

연구진이 공개한 주요 관찰 시점은 다음과 같습니다.

  • 첫 3%: 학습률 워밍업과 초기화가 안정적으로 지나가는지 확인합니다.
  • 약 10~20일: 긴 문맥과 강화학습 실험을 위한 짧은 쿨다운 테스트가 예정되어 있습니다.
  • 약 25~30%: gradient norm이 정점을 찍고 내려오는지 봅니다.
  • 약 50%: 계획대로라면 문맥을 4K에서 8K로 늘립니다.
  • 약 80%: 후반 데이터 혼합과 학습률 쿨다운의 영향이 loss에 나타날 수 있습니다.
  • 약 95% 이후: 65K와 제한적인 262K 문맥 확장이 계획되어 있습니다.

이 일정은 고정된 열차 시간표가 아닙니다. expert-parallel 커널과 token dropping 시험 결과에 따라 바뀔 수 있다고 연구진이 명시했습니다. W&B 그래프만 보는 것보다 GitHub의 결정 기록을 함께 읽어야 하는 이유입니다.

데이터 페이지는 모델의 식단표입니다

모델 구조가 뇌의 배선이라면 데이터는 수년 동안 읽힌 책과 기록입니다. 같은 구조와 같은 GPU를 써도 무엇을 얼마나 반복해서 보여주느냐에 따라 모델의 언어, 지식, 코드, 수학, 편향이 달라집니다.

Marin의 공개 기록에 따르면 원천 데이터 풀은 292개 출처의 25.6조 토큰입니다. MinHash 기반 유사 중복 제거와 휴리스틱, 주요 벤치마크에 대한 n-gram 오염 제거로 2.494조 토큰을 제외해 23.106조 토큰을 남겼습니다. 약 25만 개 문서가 벤치마크 오염 제거 과정에서 빠졌다고 기록되어 있습니다.

남은 문서는 Harrier 0.6B 임베딩으로 표현한 뒤 5,000개 군집을 만들고, 이를 다시 40개 의미 범주로 묶었습니다. 문서 품질은 GLM 5.2로 라벨을 만든 뒤 더 빠른 분류기에 증류했습니다. 공개 데이터 페이지에서는 출처별 문서가 어떤 주제와 품질 구간으로 분포하는지 표본을 볼 수 있습니다.

이 페이지에서 볼 것은 “웹 데이터가 몇 퍼센트인가” 하나가 아닙니다.

  1. 특정 출처가 한 주제를 지나치게 지배하는지 확인합니다.
  2. 고품질로 분류된 문서가 실제 읽어도 좋은지 표본을 봅니다.
  3. 코드·수학·과학·다국어 등 원하는 능력의 재료가 충분한지 봅니다.
  4. 중복 제거와 벤치마크 오염 제거가 어느 정도였는지 확인합니다.
  5. 후반 데이터 혼합이 바뀔 때 평가 loss의 변화와 연결합니다.

공개 수준에는 아직 빈틈도 있습니다. 8월 23일 확인 결과, GCS의 데이터 구성·표본 페이지는 접근할 수 있지만 GitHub 이슈에 적힌 CoreWeave 원시 데이터 저장소의 특정 공개 객체는 익명 요청에 HTTP 403을 반환했습니다. 커뮤니티도 8월 22일 같은 접근 문제를 공식 이슈 댓글로 제기했습니다. 따라서 현재 상태는 데이터 구성과 계보는 상당히 공개됐지만 원시 학습 데이터를 누구나 즉시 내려받아 완전히 재현할 수 있는 단계는 아니다라고 보는 편이 정확합니다.

오픈 웨이트에서 오픈 연구과정으로 이동합니다

Marin이 최초의 공개 언어모델 학습 프로젝트는 아닙니다. EleutherAI의 Pythia는 여러 크기의 모델과 수많은 중간 체크포인트를 공개해 학습 동역학 연구를 가능하게 했습니다. Ai2의 OLMo는 가중치뿐 아니라 데이터, 코드, 학습 레시피, 평가와 중간 체크포인트까지 공개하는 완전 개방형(fully open) 모델의 기준을 높였습니다.

Marin의 차별점은 이 전통을 대형 MoE와 랙 규모 분산학습의 진행 중 운영 기록까지 확장한다는 데 있습니다. 완성 후 정돈된 기술보고서만 내놓는 것이 아니라, 무엇을 예상했고 실제로 무엇이 달랐는지, 어떤 예행학습이 실패했고 어떤 수정을 했는지를 같은 타임라인에서 볼 수 있습니다.

이 변화의 의미는 네 가지입니다.

실패가 연구 결과로 남습니다

대규모 학습에서 실패는 흔하지만 대부분 공개되지 않습니다. d2048 래더가 81%에서 중단됐다는 사실, 긴 문맥에서 token dropping이 급증했다는 기록, 체크포인트 복구와 메모리 문제가 어떻게 수정됐는지가 남으면 다른 팀은 같은 비용을 다시 치르지 않아도 됩니다.

스케일링 법칙이 사후 설명에서 사전 예측으로 바뀝니다

완성 후 데이터를 맞춰 만든 곡선은 그럴듯해 보이기 쉽습니다. Marin은 본 학습 전에 각 진행률의 loss를 예측해두고 실제 경로와 비교합니다. 맞으면 스케일링 법칙의 실용성을 검증하고, 틀리면 데이터·문맥·아키텍처 변화가 어디서 법칙을 깼는지 배울 수 있습니다.

모델 성능의 시스템 원인이 보입니다

최종 벤치마크는 모델 구조와 데이터, 통신 효율, 장애 대응이 섞인 결과입니다. 공개 로그는 loss가 나빠진 이유가 데이터인지, 라우터 쏠림인지, 네트워크 대기인지, 학습률 오류인지 구분할 단서를 줍니다. AI 연구가 논문의 모델 도식만이 아니라 운영 가능한 시스템 공학이라는 사실이 드러납니다.

따라 할 수 있는 지식과 살 수 없는 자원이 분리됩니다

누구나 11개의 GB200 NVL72를 확보할 수는 없습니다. 공개가 컴퓨트 장벽을 없애지는 않습니다. 대신 작은 스케일에서 검증하는 법, 위험 구간을 미리 찾는 법, 어떤 지표를 남겨야 하는지, 장애 후 어떻게 복구하는지 같은 노하우의 장벽을 낮춥니다. 재현 가능한 아이디어와 재현하기 어려운 자본집약적 실행이 어디서 갈리는지도 더 선명해집니다.

loss가 내려간다고 지능과 안전이 증명되지는 않습니다

이 대시보드가 보여주지 못하는 것도 분명합니다.

  • 아직 완성 모델의 성능이 아닙니다. 사전학습 이후 지시학습, 선호학습, 강화학습과 안전 조정이 남아 있습니다.
  • loss는 진실성 점수가 아닙니다. 다음 토큰을 잘 예측해도 사실을 검증하거나 인과관계를 이해하거나 안전하게 행동한다는 보장은 없습니다.
  • 535B는 품질 보증서가 아닙니다. 데이터 품질과 라우팅, 후반학습이 나쁘면 큰 총 파라미터도 좋은 제품이 되지 않습니다.
  • 예측선은 계약이 아닙니다. 실제 데이터 혼합과 문맥 길이가 바뀌고, 가장 큰 예행학습의 마지막 19%는 외삽됐습니다.
  • 공개 기록은 완전한 재현과 다릅니다. 같은 코드가 있어도 하드웨어, 네트워크, 데이터 접근, 운영 인력이 없으면 같은 실험을 그대로 반복하기 어렵습니다.
  • 벤치마크 성능은 아직 보류해야 합니다. 최종 평가와 외부 독립 검증이 나오기 전에는 프런티어 모델과의 우열을 말할 근거가 없습니다.

가장 강한 반론은 명확합니다. 수개월 뒤 모델 성능이 기대에 못 미치면 이 프로젝트는 값비싼 공개 실험일 뿐일 수 있습니다. 그 반론은 타당합니다. 다만 공개된 예측과 로그 덕분에 실패했을 때도 “성능이 낮았다”에서 끝나지 않고 데이터, 구조, 라우팅, 통신, 후반학습 가운데 무엇이 원인이었는지 분석할 가능성이 커집니다. 공개 연구의 가치는 성공 확률만이 아니라 실패에서 회수되는 지식의 양으로도 측정해야 합니다.

5분만 본다면 이 순서가 좋습니다

처음 W&B를 열면 수백 개 지표가 보여 당황하기 쉽습니다. 다음 순서면 충분합니다.

  1. 현재 진행률과 학습률을 봅니다. 아직 워밍업인지, 어떤 예정 구간인지 먼저 확인합니다.
  2. dropless 평가 loss와 예측선을 비교합니다. 한 점보다 여러 평가 주기의 방향을 봅니다.
  3. gradient norm의 변화율을 봅니다. 약 25~30% 정점 예상과 비교해 계속 가속하는지 확인합니다.
  4. sender·receiver token dropping을 봅니다. 문맥 확장 전후에 몇 배로 뛰는지가 중요합니다.
  5. router entropy와 전문가별 부하를 봅니다. 일부 전문가만 과로하는지 확인합니다.
  6. 처리량과 MFU의 공백을 찾습니다. 갑작스러운 하락이 있으면 GitHub 이슈에서 하드웨어·통신·체크포인트 기록을 찾습니다.
  7. GitHub의 설정 변경을 읽습니다. 데이터와 문맥이 바뀐 시점 이후에는 기존 예측선을 그대로 적용하지 않습니다.

그래프 한 줄로 결론을 내리기보다 “예상 경로에서 벗어난 지표가 둘 이상이고, 여러 측정 주기 동안 돌아오지 않는가”를 보는 것이 좋습니다. 대규모 학습은 잡음이 많은 공정입니다. 사고는 한 번의 흔들림보다 여러 계기판의 지속적인 불일치로 나타납니다.

완성 모델보다 제작 장부가 먼저 공개됐습니다

Marin 535B-A23B가 강력한 모델이 될지는 아직 모릅니다. 지금 확인된 것은 거대한 모델의 성능이 아니라 거대한 학습 실험을 공개적으로 운영할 수 있다는 사실입니다.

이 공개는 “모델이 몇 점을 받았는가”보다 더 깊은 질문을 가능하게 합니다.

  • 작은 모델의 예측이 535B에서도 맞는가
  • 데이터 혼합을 바꾸면 어떤 능력이 먼저 움직이는가
  • MoE 전문가 배분은 규모가 커져도 안정적인가
  • 긴 문맥은 성능 이득보다 token dropping 비용을 더 크게 만드는가
  • GPU 계산보다 통신과 복구가 더 큰 병목이 되는 순간은 언제인가
  • 사전에 공개한 예상과 실제 결과가 얼마나 일치하는가

오픈소스 AI의 다음 단계는 최종 가중치를 내려받게 하는 데서 끝나지 않습니다. 어떤 선택과 실패를 거쳐 그 가중치가 만들어졌는지 감사할 수 있어야 합니다.

535B 모델의 가장 흥미로운 결과는 세 달 뒤 벤치마크 표에 나올 수 있습니다. 그러나 지금 이미 공개된 중요한 자산은 따로 있습니다. 프런티어 규모의 AI를 만드는 과정 자체가 관찰하고 반박하고 배울 수 있는 과학적 기록으로 바뀌고 있다는 것입니다.


참고 자료

이 글의 실행 상태와 대시보드 수치는 2026년 8월 23일 KST 기준입니다. 학습이 진행되면서 스텝, 데이터 혼합, 문맥 확장 일정과 지표는 바뀔 수 있습니다.

YS-VC | Founder Intake Desk — Intervest