Thinking Machines의 첫 공개 모델 Inkling: 맞춤형 AI를 위한 오픈 웨이트 전략
2026년 7월 15일, Thinking Machines Lab은 9,750억 개 매개변수를 가진 Inkling의 전체 가중치를 Apache 2.0 라이선스로 공개했습니다. 토큰 하나를 처리할 때 실제로 활성화되는 매개변수는 410억 개이며, 텍스트·이미지·음성을 입력받아 텍스트를 생성합니다. 최대 문맥 길이는 100만 토큰입니다.
흔히 ‘오픈소스 모델’이라고 부르지만 정확한 표현은 오픈 웨이트 모델입니다. 누구나 가중치를 내려받아 연구하고 수정하며 상업 제품에 통합할 수 있지만, 45조 토큰에 이르는 학습 데이터의 상세 목록과 전체 학습 코드는 공개되지 않았습니다. 공개의 폭을 과장하지 않으면서도, 미국의 신생 AI 연구소가 첫 자체 모델에 넓은 상업용 라이선스를 붙였다는 선택은 가볍지 않습니다.
Inkling은 Thinking Machines가 내놓은 첫 제품이 아닙니다. 연구자가 모델을 직접 후학습할 수 있는 Tinker와 실시간 음성·영상 협업을 위한 Interaction 모델을 먼저 공개했습니다. 이번 발표로 기본 모델, 맞춤화 도구, 상호작용 인터페이스가 하나의 방향으로 연결됐습니다.
공개된 것은 모델 파일 한 묶음보다 넓습니다
공식 발표와 모델 카드에서 확인되는 Inkling의 구성은 다음과 같습니다.
| 항목 | 공개 내용 | 해석할 때 주의할 점 |
|---|---|---|
| 모델 구조 | 9,750억 전체, 410억 활성 매개변수의 MoE | 거대한 전체 용량과 추론 시 계산량은 다르지만 메모리 장벽은 여전히 높음 |
| 입력과 출력 | 텍스트·이미지·음성 입력, 텍스트 출력 | 영상은 사전학습 데이터에 포함됐지만 공개 모델의 직접 입력 사양은 이미지와 음성 중심 |
| 문맥 길이 | 공개 가중치 기준 최대 100만 토큰 | Tinker에서는 현재 6만4,000·25만6,000 토큰 옵션 제공 |
| 사전학습 | 텍스트·이미지·음성·영상 45조 토큰 | 데이터 출처는 공개 웹, 제3자 취득, 합성 데이터라는 범주만 제시 |
| 후학습 | 3,000만 회가 넘는 강화학습 롤아웃 | 회사 자체 집계이며 외부에서 전체 과정을 재현한 결과는 아직 없음 |
| 라이선스 | Apache 2.0 | 가중치 사용은 넓게 허용되지만 학습 데이터와 파이프라인 전체가 공개된 것은 아님 |
| 배포 | BF16, NVFP4 체크포인트와 여러 추론 엔진 연동 | BF16은 최소 2TB, NVFP4도 최소 600GB의 합산 GPU 메모리 필요 |
Mixture-of-Experts(MoE)는 모든 매개변수를 매번 사용하는 대신 입력 토큰마다 일부 전문가 모듈을 골라 계산합니다. Inkling은 256개 선택형 전문가 중 6개와 공용 전문가 2개를 활성화합니다. 66개 층으로 구성됐고, 가까운 문맥을 보는 어텐션과 전체 문맥을 보는 어텐션을 섞어 긴 입력을 처리합니다.
공개 저장소의 크기는 약 1.9TB입니다. Hugging Face 저장소에는 BF16 가중치가 108개 파일로 나뉘어 올라와 있습니다. 공식 모델 카드에 따르면 BF16 체크포인트는 B300 8장 또는 H200 16장, NVFP4 체크포인트는 B300 4장 또는 H200 8장 수준의 구성이 필요합니다.
가중치를 내려받을 자유와 개인이 로컬 컴퓨터에서 실행할 수 있는 접근성은 같은 말이 아닙니다. Inkling의 공개는 개발자에게 수정·감사·이식의 권리를 넓히지만, 실제 운영은 상당 기간 대형 GPU 사업자와 전문 추론 서비스에 의존할 가능성이 높습니다.
더 작은 Inkling-Small도 예고됐습니다. 전체 2,760억 개, 활성 120억 개 매개변수로 설계됐고 여러 평가에서 큰 모델과 비슷한 결과를 냈다는 것이 회사 설명입니다. 다만 2026년 7월 16일 현재는 시험 중인 미리보기이며 가중치는 아직 공개되지 않았습니다. 넓은 개발자 채택에는 본 모델보다 Inkling-Small의 실제 크기, 품질, 실행 비용이 더 중요할 수 있습니다.
성능표는 강한 범용 모델과 남은 격차를 함께 보여줍니다
Thinking Machines는 Inkling을 현재 가장 강한 모델이라고 주장하지 않았습니다. 공식 발표에서도 공개·비공개 모델을 통틀어 종합 최강은 아니라고 적었습니다. 대신 멀티모달 입력, 에이전트형 도구 사용, 조절 가능한 추론량, 후학습 적응성을 함께 갖춘 기본 모델로 소개했습니다.
초기 외부 측정은 이 설명과 대체로 맞습니다. Artificial Analysis가 발표 당일 수행한 평가에서 Inkling은 Intelligence Index 41점을 기록해 당시 미국 연구소가 공개한 오픈 웨이트 모델 중 가장 높은 점수를 받았습니다. 평가 과제당 평균 출력 토큰은 약 2만5,000개로, 비교한 주요 오픈 웨이트 모델의 3만7,000~4만3,000개보다 적었습니다.
에이전트형 업무에서는 비교적 강했습니다. 회사 모델 카드 기준 SWE-bench Verified 77.6%, MCP Atlas 74.1%를 기록했습니다. 이미지와 음성을 함께 다루는 평가에서도 공개 모델 중 경쟁력 있는 결과를 제시했습니다. 추론 강도를 0.2에서 0.99 사이로 조절해 품질과 생성 토큰 수를 바꿀 수 있다는 점은 긴 에이전트 작업에서 비용과 지연을 관리하는 데 유용합니다.
약점도 보입니다. Artificial Analysis의 사실성 평가에서는 정확도 40%, 환각률 63%가 보고됐습니다. 회사 모델 카드의 SimpleQA Verified도 43.9%로 여러 비공개 모델보다 낮았습니다. 긴 문맥, 멀티모달, 코딩 능력이 곧 사실 정확성을 보장하지는 않습니다.
비교 조건도 통일돼 있지 않습니다. Inkling의 코딩 평가는 자체 하네스와 최대 25만6,000 토큰의 작업 궤적을 사용했고, 다른 모델 점수 일부는 각 회사가 보고한 수치입니다. 예측 평가에는 최종 공개본과 다른 체크포인트가 쓰였습니다. 공개 하루 만에 나온 성능표는 출발점일 뿐이며, 공통 하네스와 동일한 토큰 예산에서의 독립 재현이 필요합니다.
첫 모델은 회사의 미션을 기술 구조로 옮겼습니다
Thinking Machines는 자신의 미션을 “사람의 의지와 판단을 확장하는 AI”로 설명합니다. 회사의 미션 문서는 현장의 지식이 중앙에 고정된 데이터베이스처럼 존재하지 않는다고 봅니다. 조직과 개인이 일하면서 만드는 암묵적이고 지역적인 지식은 계속 바뀌므로, AI도 사용자의 피드백을 받아 각 환경에 맞게 달라져야 한다는 주장입니다.
이 관점은 네 가지 기술 선택으로 이어집니다.
- 경쟁력 있는 기본 모델을 직접 학습합니다.
- 사용자가 자신의 데이터와 평가 기준으로 가중치를 바꿀 수 있는 도구를 제공합니다.
- 음성·영상·텍스트를 오가며 사람이 작업 중에 개입할 수 있는 인터페이스를 개발합니다.
- 모델이 만들어지는 원리를 이해하고 수정할 수 있도록 연구와 구현 자료를 공개합니다.
Inkling은 첫 번째 항목을 채우면서 나머지 세 항목을 연결합니다. Tinker는 연구자가 데이터, 보상 함수, 평가 환경을 정하면 분산 학습 인프라를 대신 운영하는 API입니다. LoRA 방식의 미세조정과 강화학습을 지원하고, 저장한 체크포인트를 내려받을 수 있습니다. 회사는 Tinker 고객의 학습 데이터를 자체 모델 학습에 사용하지 않는다고 밝히고 있습니다.
Interaction 모델은 사용자의 음성·영상 입력을 200밀리초 단위로 계속 받아들이는 실시간 모델과, 긴 추론과 도구 사용을 맡는 배경 모델을 나눕니다. Inkling은 이 체계에서 배경 추론 모델로 쓰이도록 설계됐습니다. 사람이 대화를 멈추고 긴 답변을 기다리는 구조에서 벗어나, 작업 도중 끼어들고 고치며 방향을 바꾸게 하려는 시도입니다.
발표에 포함된 ‘자기 미세조정’ 시연도 같은 메시지를 담고 있습니다. Inkling은 Tinker 안에서 특정 글자를 쓰지 않는 답변을 목표로 데이터와 평가 함수를 만들고, 약 27분 동안 학습한 뒤 새 체크포인트로 전환했습니다. 과제 자체는 단순하지만 모델이 후학습 작업의 사용자이자 대상이 되는 흐름을 보여줬습니다. 실제 업무에서는 사람이 목표, 데이터 권리, 평가 기준, 배포 승인을 통제해야 합니다.
오픈 웨이트는 사업 전략이기도 합니다
Inkling의 가중치를 열었다고 해서 Thinking Machines가 모델 사업을 포기한 것은 아닙니다. 공개 모델을 중심으로 Tinker의 학습 수요를 늘리고, Interaction 모델의 배경 지능을 공급하며, 외부 추론 사업자가 배포를 맡는 구조를 만들 수 있습니다.
이 구조에서 기본 가중치는 개발자와 연구자를 모으는 공용 기반이 됩니다. 수익과 차별화는 데이터 준비, 평가 설계, 후학습 인프라, 실시간 인터페이스, 안정적인 서빙으로 이동합니다. 이는 공개 사실을 바탕으로 한 전략적 해석이며, 회사가 구체적인 장기 수익 구조를 발표한 것은 아닙니다.
잠금 효과를 줄이는 장치도 있습니다. Tinker 사용자는 자신이 만든 체크포인트를 내려받을 수 있고, Inkling은 SGLang·vLLM·Hugging Face·llama.cpp 계열 도구와 연동될 예정입니다. 여러 클라우드 추론 사업자도 배포 파트너로 이름을 올렸습니다. 특정 API에서만 쓸 수 있는 모델보다 이동 경로가 넓습니다.
아직 모든 경로가 성숙한 것은 아닙니다. 2026년 7월 16일 확인 기준 SGLang 지원 PR은 열려 있었고, vLLM 지원 PR은 초안 상태였습니다. vLLM 구현은 기본 검증 시험을 통과했지만 H200 구성에서 충돌이 보고되기도 했습니다. 발표 당일 지원은 생태계의 준비 속도를 보여주지만, 운영 안정성을 보증하지는 않습니다.
AI 생태계에는 다섯 가지 압력이 생깁니다
1. 미국 오픈 웨이트 진영의 선택지가 늘어납니다
Artificial Analysis의 발표 당일 평가에서 Inkling은 미국 연구소의 공개 모델 중 가장 높은 종합 점수를 기록했습니다. 세계 전체 오픈 웨이트 선두를 뜻하지는 않습니다. 회사가 공개한 비교표에서도 GLM과 Kimi 계열은 여러 추론·에이전트 평가에서 Inkling을 앞섰습니다.
그래도 Apache 2.0, 네이티브 이미지·음성 입력, 에이전트형 도구 사용, 100만 토큰 문맥을 한 모델에 묶은 미국산 선택지가 생겼습니다. 규제, 데이터 위치, 공급망 다변화를 고려하는 기업과 공공 연구기관에는 선택지 자체가 가치가 있습니다.
2. 경쟁 단위가 기본 모델에서 후학습 체계로 넓어집니다
기업이 원하는 결과는 공개 벤치마크 최고점보다 자사 업무에서의 성공률, 오류 비용, 지연, 보안에 가깝습니다. Inkling과 Tinker의 결합은 모델을 고르는 일과 데이터·평가·강화학습 환경을 설계하는 일을 한 흐름으로 묶습니다.
기본 모델 회사들은 앞으로 미세조정 API만 제공하는 데 그치지 않고, 평가셋 관리, 합성 데이터 생성, 보상 설계, 체크포인트 비교와 되돌리기까지 지원해야 할 수 있습니다. 애플리케이션 회사도 프롬프트 연결만으로 차별화하기 어려워지고, 자체 업무 데이터와 평가 루프를 얼마나 잘 운영하는지가 중요해집니다.
3. 추론·학습 인프라의 가치가 커집니다
1.9TB의 가중치와 최소 600GB의 GPU 메모리 요구량은 공개 모델의 실제 사용 경로를 클라우드로 돌립니다. SGLang은 Thinking Machines와 공동 작성한 기술 문서에서 Blackwell GPU용 전용 커널, 추측 디코딩, 다중 LoRA 서빙, 강화학습 연동을 공개했습니다.
새 모델이 나올 때마다 구조에 맞는 커널, 양자화, 캐시, 병렬화, 학습·추론 정합성이 필요합니다. 가중치가 공개될수록 이를 빠르게 최적화하는 추론 엔진, GPU 클라우드, 후학습 플랫폼의 역할은 오히려 커집니다. 모델 접근의 병목이 API 허가에서 컴퓨팅 비용과 운영 역량으로 이동합니다.
4. 기업은 모델보다 학습 루프의 소유권을 따지게 됩니다
체크포인트를 내려받고 다른 서빙 환경으로 옮길 수 있다는 점은 기업에 협상력을 줍니다. 모델을 자사 데이터로 조정한 뒤 공급업체를 바꾸더라도 학습 결과를 보존할 수 있기 때문입니다.
가중치 파일만으로 이동성이 완성되지는 않습니다. 학습 데이터, 평가셋, 보상 함수, 도구 연결, 안전 정책, 실행 기록도 함께 보존돼야 합니다. Tinker는 체크포인트 내보내기와 고객 데이터 비학습 원칙을 명시했지만, 실제 기업 도입에서는 데이터 보관 기간, 삭제, 감사, 지역별 처리, 재현 가능한 학습 설정을 계약과 운영에서 확인해야 합니다.
5. 안전 책임이 배포자에게 더 많이 이동합니다
Thinking Machines는 외부 안전 시험과 위험 능력 평가를 수행했고, Inkling이 기존 공개 모델 생태계보다 중대한 위험을 더하지 않는다고 판단했습니다. 동시에 역할극이나 간접적인 유해 요청에 응하는 잔여 위험을 모델 카드에 적고, 입력·출력 필터와 모니터링을 겹쳐 쓰라고 권고했습니다.
오픈 웨이트 모델은 후학습으로 행동을 바꿀 수 있습니다. 기본 모델의 거부 성능이 높더라도 수정된 체크포인트가 같은 안전 특성을 유지한다고 볼 수 없습니다. 모델 제공자, 후학습 플랫폼, 배포 사업자, 애플리케이션 운영자 사이의 책임 경계가 더 세밀해져야 합니다.
아직 답이 없는 질문
첫째, 독립적인 운영 데이터가 없습니다. 발표 후 하루밖에 지나지 않았고, 대부분의 수치는 회사 또는 협력사가 구성한 환경에서 나왔습니다. 같은 하드웨어와 토큰 예산으로 재현한 품질·속도·비용 자료가 쌓여야 합니다.
둘째, 학습 데이터의 투명성이 제한적입니다. 학습 데이터 문서는 공개 인터넷, 제3자 데이터, 합성 데이터와 지식재산권·개인정보가 포함될 수 있다는 범주만 설명합니다. 45조 토큰의 구성, 언어 비중, 제거 요청 처리, 데이터별 권리 상태는 확인하기 어렵습니다.
셋째, 한국어 성능은 별도 검증이 필요합니다. 모델 카드는 다국어 지원을 밝히지만 한국어 평가 결과를 따로 제시하지 않았습니다. 존댓말, 문서 형식, 법률·의료·금융 용어, 음성 인식의 억양과 소음 환경은 영어 중심 종합 점수로 판단할 수 없습니다.
넷째, 작은 모델의 공개가 남아 있습니다. 대형 Inkling은 연구기관과 인프라 사업자에게 유용하지만 많은 개발자가 직접 다루기 어렵습니다. 활성 120억 개 규모의 Inkling-Small이 실제로 공개되고 범용 하드웨어에서 어느 정도 품질과 속도를 내는지가 채택 범위를 좌우할 수 있습니다.
다섯째, 맞춤화가 일반화될수록 평가가 병목이 됩니다. 모델이 스스로 데이터와 보상 함수를 만들 수 있어도, 목적을 잘못 설정했거나 평가가 허술하면 그 오류를 더 빠르게 학습할 뿐입니다. 사람이 원하는 결과를 측정 가능한 기준으로 바꾸고, 배포 전후의 성능 저하를 감시하는 역량이 필요합니다.
Inkling 이후 확인할 신호
- Inkling-Small 가중치의 실제 공개 시점과 하드웨어 요구량
- SGLang·vLLM 등 주요 추론 엔진의 정식 병합과 장기 안정성
- 동일 토큰 예산에서 수행한 독립 벤치마크와 실제 업무 성공률
- 한국어·음성·긴 문맥에서의 제3자 평가
- Tinker에서 만들어진 공개 미세조정 모델과 기업 사례의 증가
- 후학습 뒤 안전성과 사실성이 어떻게 달라지는지 보여주는 재평가 자료
- 학습 데이터 구성과 권리 처리에 관한 추가 공개
맺으며
Inkling은 Thinking Machines가 대규모 멀티모달 모델을 처음부터 학습하고, 3,000만 회가 넘는 강화학습 롤아웃을 운영하며, 배포 생태계까지 준비할 수 있음을 보여준 첫 실행 증거입니다. 동시에 회사가 말해온 사람의 판단, 현장 지식, 지속적인 맞춤화를 실제 제품 구조로 묶었습니다.
이 모델의 장기적 의미는 종합 점수 1위 여부로 결정되지 않을 가능성이 큽니다. 개발자와 기업이 가중치를 내려받는 데서 그치지 않고 자신의 데이터와 평가 기준으로 모델을 바꾸고, 그 결과를 다른 인프라로 옮기며, 실제 업무에서 반복 개선할 수 있어야 합니다.
Inkling이 성공한다면 오픈 웨이트 모델 경쟁의 기준도 달라질 수 있습니다. 가장 똑똑한 단일 모델을 고르는 경쟁에서, 조직마다 다른 지식과 판단을 얼마나 빠르고 안전하게 모델에 반영할 수 있는지를 겨루는 경쟁으로 넓어집니다. 공개 가중치는 그 출발점이며, 후학습·평가·배포·상호작용을 잇는 생태계가 결과를 결정합니다.
출처: Thinking Machines Lab의 Inkling 발표문·모델 카드·미션 문서·Tinker 및 Interaction 모델 설명·학습 데이터 문서, Hugging Face 공개 저장소, Artificial Analysis의 2026년 7월 15일 독립 평가, SGLang·vLLM 공개 구현 자료. 발표 직후 자료이므로 벤치마크와 배포 상태는 바뀔 수 있으며, 회사·협력사가 보고한 수치는 별도 귀속했습니다. 정보 제공 목적의 기술·산업 분석이며 특정 기업이나 자산에 대한 투자 판단은 포함하지 않았습니다.