예측 모델은 싸지고, 결정 루프는 비싸집니다
기업이 미래를 보여 달라고 요청하면 AI는 이미 꽤 좋은 답을 냅니다. 수요, 이탈, 부도, 고장 가능성을 예측하는 모델을 만드는 시간과 비용도 빠르게 내려갑니다. 그런데 기업은 예측 그 자체로 움직이지 않습니다. 어떤 주문을 줄이고, 어느 고객에게 한도를 부여하고, 어떤 공급자를 바꿀지 선택해야 합니다. 선택에는 비용과 제약, 승인권자, 실행 시스템, 뒤늦게 나타나는 결과가 붙습니다.
그래서 기업용 의사결정 기술의 경쟁축이 바뀌고 있습니다. 더 잘 맞히는 단일 모델에서, 데이터를 읽고 의미를 맞추고 미래를 예측한 뒤 여러 행동을 비교하고, 사람의 승인을 받아 실행하고, 실제 결과를 다시 배우는 결정 루프(decision loop)로 이동합니다.
핵심 결론은 간단합니다. 예측 모델은 빠르게 싸지지만, 기업의 의미·제약·승인·실행·결과학습을 닫는 결정 루프는 비싸게 남습니다. 독립 기업은 이 루프 안에서 수직 통제점을 소유해야 합니다. 그렇지 않으면 ERP·클라우드·데이터 플랫폼의 기능 흡수를 견디기 어렵습니다.
예측의 초기비용은 빠르게 내려갑니다
시계열에서는 Amazon의 Chronos-2가 단변량, 다변량, 공변량 예측을 하나의 zero-shot 모델로 다루고, Google의 TimesFM 연구는 새 업무의 예시를 문맥으로 주는 in-context forecasting을 제시합니다. 회사마다 예측 모델을 처음부터 설계하지 않아도 되는 선택지가 늘고 있습니다.
표형 데이터에서도 비슷한 변화가 일어납니다. 2025년 1월 Nature에 게재된 TabPFN 연구는 작은 데이터에서 별도 하이퍼파라미터 탐색을 크게 줄였고, 명시적 적용 범위를 1만 행·500개 특성까지로 제시했습니다. 2026년 Prior Labs는 TabPFN-3가 H100 환경에서 최대 100만 행과 관계·텍스트까지 다룬다고 회사 기술보고서에서 주장했습니다. 뒤의 수치는 아직 독립 재현보다 회사 보고에 가깝지만, 범용 사전학습 모델이 시계열에서 표와 관계형 데이터베이스로 넓어지는 방향은 분명합니다.
모델의 초기비용이 내려가도 기업의 문제가 사라지는 것은 아닙니다. 주문 취소와 반품을 같은 사건으로 볼지, 매출과 서비스 수준 가운데 무엇을 우선할지, 어떤 고객군에 법적으로 다른 정책을 쓰면 안 되는지는 모델이 혼자 확정할 수 없습니다. 범용 모델이 싸질수록 기업별 데이터 의미, 정책, 실행, 감사의 상대적 가치가 올라갑니다.
정확한 예측과 좋은 결정은 다릅니다
예측 모델은 다음 상태의 분포를 계산합니다. 결정 시스템은 행동을 고릅니다. 같은 수요 예측이라도 공급망 책임자는 품절과 재고를, 재무 책임자는 현금을, 영업 책임자는 서비스 수준을 다르게 가중합니다. 목표와 제약이 바뀌면 같은 예측에서 반대 결정이 나옵니다.
이 차이를 정면으로 다루는 분야가 결정 중심 학습(decision-focused learning)입니다. 2025년의 DF² 연구와 2026년 UAI의 robust decision-focused learning 연구는 불확실성과 분포 이동에서 최종 결정의 후회비용(regret)을 직접 다룹니다. 중요한 메시지는 예측 정확도를 높여도 결정이 반드시 좋아지는 것은 아니라는 점입니다.
기업의 평가표도 달라져야 합니다. RMSE, AUC, 정확도 옆에 현행 정책 대비 손익 개선, 제약 위반률, 사람의 번복률, 실행 지연, 결과 회수율을 놓아야 합니다. 오프라인 benchmark에서 이긴 모델이 실제 데이터를 받는 shadow mode에서 기존 규칙을 이기지 못하면 배치해서는 안 됩니다.
인과 foundation model은 유망하지만 연구가 앞서 있습니다
기업의 진짜 질문은 “무슨 일이 일어날까”보다 “가격을 바꾸거나 공급자를 교체하면 무엇이 달라질까”에 가깝습니다. 2026년의 Arrow, CDFM, DAG-FM, TabPFN-CFM은 구조학습, 처치효과, 반사실 예측을 범용 사전학습으로 옮기려 합니다.
방향은 중요하지만 성숙도를 과장하면 안 됩니다. 이 자료의 상당수는 아직 preprint이고, CDFM 연구 자체도 제한된 관측 데이터에서는 인과 사전지식이 필수적이라고 보고합니다. 기업 데이터에 상관관계가 많다는 이유만으로 경영 레버의 효과가 자동으로 드러나지는 않습니다. 원인 구조, 개입 가능 변수, 시간 순서, 사용 금지 변수를 전문가가 검토하고 실제 실험이나 준실험으로 교정해야 합니다.
현재의 합리적 사용법은 완전자동 인과발견보다 가설 공간을 줄이고 실험을 설계하는 것입니다. 화려한 causal graph보다 알려진 개입 결과를 가린 뒤 효과를 맞히는지, 기존 정책보다 regret를 낮추는지, 잘못된 원인 구조를 발견하고 사람에게 넘기는지 확인해야 합니다.
디지털 트윈은 세 종류로 나눠야 합니다
디지털 트윈이라는 말은 서로 다른 신뢰 문제를 하나로 묶습니다. 의미·데이터 트윈은 고객, 주문, 자산, 정책의 관계를 기업 공통 언어로 만듭니다. Palantir의 Ontology와 o9의 Enterprise Knowledge Graph가 이 층에 가깝습니다. 프로세스·운영 트윈은 주문, 생산, 물류, 승인 흐름과 물리·업무 제약을 재현합니다. 공급망 계획과 process orchestration이 여기에 속합니다. 인간·시장 트윈은 소비자나 조직 구성원의 반응을 생성 에이전트로 근사합니다.
세 유형의 차이는 관측 가능성과 교정 가능성입니다. 공장과 공급망은 센서, 주문, 재고, 납기 결과가 남습니다. 인간의 신념과 전략적 반응은 직접 관측하기 어렵고 시간이 지나며 바뀝니다. 같은 “twin”이라는 이름을 붙여도 요구할 검증 강도가 달라야 합니다.
인간·시장 트윈은 가장 눈길을 끄는 영역입니다. Stanford 연구진은 1,052명의 2시간 인터뷰로 생성 에이전트를 만들고, General Social Survey 응답을 개인의 2주 후 자기 재검사 신뢰도 대비 85% 수준 재현했다고 보고했습니다. AgentSociety는 최대 1만 agent와 500만 회 상호작용을 제시했습니다. 이는 대규모 사회적 실험장을 만드는 기술 진전입니다.
그러나 85%는 현실 예측의 절대 정확도가 아니라 사람 자신의 응답 안정성을 기준으로 한 상대 지표입니다. 방법론 리뷰는 fidelity, calibration, reproducibility를 미해결 과제로 지적합니다. Gallup도 2026년 5월 Simile의 합성 응답을 독립 검증하기 시작했다고 발표했을 뿐 최종 인증 결과를 낸 것은 아닙니다. 이 주제는 기존의 소셜 월드 모델과 합성 소비자 조사 글에서 더 자세히 다뤘습니다.
고객은 새 카테고리보다 기존 결정 예산으로 삽니다
상용 시장은 “의사결정 시뮬레이터”라는 하나의 카테고리로 만들어지지 않았습니다. 공급망에서 o9과 Kinaxis, 금융 리스크에서 Taktile과 Quantexa, 재무 계획에서 Pigment, 프로세스에서 Celonis와 Aera, 상위 데이터·행동 계층에서 Palantir가 같은 결정 루프를 향해 수렴합니다.
공통점은 기존 budget owner가 있다는 것입니다. 공급망 책임자는 품절·재고·납기를, 리스크 책임자는 손실·승인율·규제 준수를, CFO는 계획 주기와 예측 편차를 삽니다. “AI 의사결정”이라는 새 예산을 만드는 것보다 기존 책임자의 손익계정에 들어가는 편이 빠릅니다.
좋은 진입 업무는 빈도가 높고 선택지가 명시적이며 결과가 관측되고 오류 비용을 계산할 수 있습니다. 신용 한도에는 신청자 데이터, 정책 제약, 승인 결과, 상환 성과가 연결됩니다. 재고 재배치에는 SKU, 창고, 운송 제약, 품절과 서비스 수준이 연결됩니다. 반대로 “앞으로 시장이 어떻게 될까”처럼 열린 질문은 기준선과 책임자가 모호해 반복 구매로 이어지기 어렵습니다.
2025년 이후 o9, Kinaxis, Aera, Celonis는 모두 agent를 계획과 오케스트레이션에 붙였습니다. 자연어 질의와 추천은 사용 장벽을 낮추지만 agent 자체가 해자는 아닙니다. 실제 제품 경계는 어떤 데이터에 접근하고, 어떤 정책을 적용하며, 어느 시스템에 얼마나 쓸 수 있는지입니다. Kinaxis는 공급사 고객 사례로 40번 클릭을 4번으로 줄였다고 밝혔습니다. 산술상 90% 감소이지만 손익 개선을 뜻하지 않으며 회사가 고른 사례라는 한계가 있습니다.
도입은 관측, 추천, 시나리오 비교, 인간 승인 실행, 제한 자동화 순으로 올라가는 편이 합리적입니다. 각 단계에서 입력 스냅샷, 모델과 정책 버전, 추천 근거, 승인자, 실행 결과를 재현할 수 있어야 합니다. 초기에는 read-only 추천으로 들어가도 장기 확장은 고객이 더 많은 결정 객체와 실행권한을 위임할 때 일어납니다. 좌석이나 질의량보다 위임된 결정 범위가 더 좋은 사용량 지표일 수 있습니다.
자본은 결정 표면으로 몰리고 있습니다
Quantexa는 2025년 3월 1억7,500만 달러 Series F를 26억 달러 가치로 조달했다고 발표했습니다. 회사는 연간 반복매출 1억 달러 초과와 2024년 라이선스 매출 40% 성장을 함께 주장했습니다. Pigment는 2024년 4월 1억4,500만 달러 Series D를 발표하며 ARR 3배, 고객 수 2배, 고객의 90%가 여러 부서에서 쓴다고 밝혔습니다. 성장 수치는 모두 회사 발표이며 독립 감사치가 아닙니다.
Taktile은 2025년 2월 5,400만 달러 Series B를 발표했습니다. 투자자 자료는 2024년 고객 수 4배, ARR 3.5배, 월 수억 건의 의사결정을 언급합니다. 금융 서비스는 정책 책임자, 규제, 결과 라벨이 함께 존재해 수직형 결정 엔진이 자리 잡기 좋은 시장입니다. 다만 순매출 유지율, 전문 서비스 비중, 실제 자동 실행률은 공개 자료만으로 확인할 수 없습니다.
합성 인간 시뮬레이션에는 자본이 더 빠르게 들어왔습니다. Index Ventures 공식 자료에 따르면 Simile은 2026년 2월 12일 1억 달러 Series A, 7월 30일 2억 달러 Series B를 발표했습니다. 공개 조달액 합계는 3억 달러이고 발표 간격은 168일입니다. TechCrunch는 20억 달러 가치를 보도했지만 공식 발표에서 확인되지 않아 보도치로만 봐야 합니다. 자본 유입은 시장 기대의 증거이지 장기 예측 정확도의 증거가 아닙니다.
모델은 대형 플랫폼에 빠르게 흡수됩니다
SAP는 2026년 5월 4일 Prior Labs 인수 계약을 발표했습니다. 거래 조건은 공개하지 않았고 규제 승인 전입니다. SAP는 같은 발표에서 유럽 sovereign AI 역량에 4년간 10억 유로 이상 투자하겠다고 밝혔습니다. 단순 평균은 연 2억5,000만 유로이지만 실제 집행 속도나 인수가격으로 해석해서는 안 됩니다.
이 거래는 표형 foundation model의 전략적 가치를 입증하면서 독립 모델 회사의 배포면 위험도 보여줍니다. SAP는 모델을 ERP의 데이터와 업무에 바로 붙일 수 있습니다. Celonis도 2025년 Emporix의 orchestration 제품을 가져와 문제 발견에서 실행으로 범위를 넓혔습니다. 모델과 agent가 싸질수록 설치 기반과 쓰기 권한을 가진 플랫폼이 인접 기능을 제품 묶음에 넣을 유인이 커집니다.
이 지형도는 원천기술의 참신함과 독립 기업의 방어력이 같은 축이 아니라는 점을 보여줍니다. 아래 계층의 회사일수록 별도의 배포면과 업무 통제점을 확보했는지가 가치의 지속성을 좌우합니다. 구체적인 확인 항목은 뒤의 VC 체크리스트에서 도입, 확장, 대체 위험의 순서로 연결합니다.
가장 위험한 오류는 그럴듯한 잘못된 세계입니다
시뮬레이터는 여러 미래 경로를 보여주기 때문에 불확실성을 잘 다루는 것처럼 보입니다. 그러나 입력의 선택 편향, 누락된 인과 변수, 오래된 정책, 획일화된 agent 반응이 있으면 모든 시나리오가 같은 잘못된 세계관 안에서 정교해집니다. 시각적 설득력은 검증력이 아닙니다.
결과 피드백도 양면적입니다. 실제 결정과 결과가 돌아오면 강한 해자가 되지만 배치된 정책이 다음 학습 데이터를 바꿉니다. 승인받지 못한 신청자의 상환 결과는 관측되지 않고, 추천하지 않은 상품의 구매 결과도 사라집니다. holdout, 탐색 정책, counterfactual audit 없이 과거 결정만 학습하면 모델은 자기 선택을 성공으로 오해할 수 있습니다.
NIST AI Risk Management Framework는 법적 강제 규정은 아니지만 인간 역할, 데이터·모델 문서화, 독립적인 test·evaluation·verification·validation, 수명주기 모니터링을 최소선으로 제시합니다. “human in the loop”라는 문구보다 사람이 실제로 개입할 시간과 정보, 권한이 있는지, 거절에 불이익이 없는지 확인해야 합니다. rollback과 fallback도 시연이 아니라 운영 테스트로 검증해야 합니다.
규제는 모델보다 현실의 결정을 봅니다
EU 집행위원회의 2026년 8월 현재 AI Act 공식 안내는 고용, 근로자 관리, 신용도 평가 등 특정 용도가 high-risk 범주가 될 수 있다고 설명합니다. 위험관리, 데이터 품질, 기록, 기술문서, 인간 감독, 정확성·견고성·사이버보안 의무가 붙습니다. 공식 일정은 투명성 규칙이 2026년 8월 적용 단계에 들어갔다고 설명하며, 최근 변경을 반영한 일부 high-risk 의무에 2027년 12월 2일을 안내합니다. 실제 적용은 용도와 사업자의 법적 역할별 검토가 필요합니다.
Colorado Attorney General의 현행 안내에 따르면 개정 Colorado AI Act는 2027년 1월 1일 발효 예정이며 교육, 고용, 금융, 의료 등 consequential decision의 알고리즘 차별을 다룹니다. 일정과 세부 의무는 다시 바뀔 수 있으므로 배치 시점에 최신 법을 확인해야 합니다.
규제는 판매를 늦추지만 제대로 제품화하면 진입장벽이 됩니다. 재현성, 데이터 계보, 승인 로그, 정책 버전, 실행 한도, rollback을 공통 control plane으로 제공하면 새 고객과 국가를 configuration으로 흡수할 수 있습니다. 반대로 고객별 컨설팅과 수작업 문서로 대응하면 매출은 생겨도 총마진과 확장성이 훼손됩니다.
가장 강한 반론은 플랫폼이 전체 루프를 흡수한다는 것입니다
이 글의 결론에 대한 가장 강한 반론은 결정 루프마저 ERP·클라우드·데이터 플랫폼의 기본 기능이 된다는 시나리오입니다. 범용 모델이 고객별 ontology와 정책 초안을 만들고, 기존 플랫폼이 최적화·승인·감사·결과학습을 계약에 포함하면 독립 제품의 통합 프리미엄은 사라집니다. 고객이 추천 화면만 보고 실행을 기존 시스템과 사람에게 남기면 제품은 결정 시스템이 아니라 분석 UI입니다.
이 반론은 결론을 뒤집기보다 범위를 좁힙니다. 모든 decision intelligence 회사가 유망한 것이 아닙니다. 반복 업무의 실행권한과 결과 피드백을 제품화한 수직 통제점만 방어력이 있습니다. 고위험 수직 업무의 정책, 규제, 유통, 신뢰는 대형 플랫폼도 단숨에 복제하기 어렵습니다. 반대로 모델 성능이나 ontology라는 단어만으로 높은 가치를 정당화하기는 어렵습니다.
현재 판단을 바꿀 조건도 명확합니다. 플랫폼 기능 출시 뒤 독립 제품의 갱신률과 가격이 구조적으로 하락하거나, 신규 고객 구축시간이 고객 수가 늘어도 줄지 않으면 테시스를 낮춰야 합니다. 합성 인간 시뮬레이션이 독립 장기 검증에서 기존 조사보다 반복적 우위를 만들지 못해도 해당 하위 테시스를 내려야 합니다.
VC가 먼저 확인할 것은 고객이 위임한 결정 범위입니다
이 시장의 차별적 지표는 agent 수나 모델 benchmark가 아닐 수 있습니다. 고객이 위임한 결정 범위가 실질 사용량에 더 가깝습니다. 승인된 자동 실행 한도, 인간 승인 실행의 고객 비중, 정책 재사용률, 결과 회수율, 신규 workflow 구축기간을 봐야 합니다.
첫째, 반복 결정 업무를 확인해야 합니다. 누가 어떤 예산으로 얼마나 자주 어떤 선택을 하는지 정의합니다. 둘째, 실행권한을 확인해야 합니다. read-only 추천, 인간 승인 실행, 제한 자동화의 고객 비중을 나눕니다. 셋째, 결과 라벨 접근권을 확인해야 합니다. 고객 계약과 데이터 구조가 실제 결과를 제품에 돌려주는지 봅니다.
넷째, 구축경제성을 확인해야 합니다. 고객과 workflow가 늘수록 ontology·정책·통합 작업이 재사용되는지, 전문 서비스 비중이 낮아지는지 봅니다. 다섯째, 플랫폼 대체 테스트를 해야 합니다. 고객이 이미 쓰는 ERP, 데이터, process 플랫폼으로 같은 업무를 구현했을 때도 남는 정책·유통·신뢰 자산이 무엇인지 묻습니다.
예측 모델의 희소성은 줄어듭니다. 인과 foundation model과 인간·시장 시뮬레이션은 가능성을 넓히지만 검증의 부담도 키웁니다. 결국 돈을 받는 제품은 미래를 그럴듯하게 보여주는 화면이 아니라, 기업이 책임 있게 행동하고 결과를 배울 수 있게 만드는 시스템입니다. 기업용 의사결정 시장에서 기술 진보와 지속 가능한 사업을 가르는 선은 모델의 앞이 아니라 실행의 뒤에 있습니다.