코드가 에이전트의 '뼈대'가 된다: 'Code as Agent Harness'를 투자자의 눈으로 읽었습니다
요즘 AI 에이전트(스스로 판단해 여러 단계를 이어 수행하는 AI 시스템)를 보면, 한 가지 변화가 눈에 띕니다. 코드의 역할이 달라지고 있다는 점입니다. 일리노이대학교(UIUC) 연구진을 중심으로 여러 기관의 연구자들이 함께 낸 서베이 Code as Agent Harness는 이 변화를 정면으로 다룹니다. 저자 명단에는 그래프·데이터마이닝 분야로 잘 알려진 Hanghang Tong, Jingrui He 등이 포함되어 있습니다. 이 글에서는 처음 보시는 분도 편하게 따라오실 수 있게 내용을 풀고, 투자자라면 무엇을 보면 좋을지까지 정리해 보겠습니다.
결과물이던 코드가, 에이전트의 바탕이 되다
논문의 출발점은 단순합니다. 지금까지 코드 생성은 주로 "AI가 얼마나 정확한 코드를 만들어 내느냐"의 문제였습니다. 경쟁 프로그래밍부터 실제 소프트웨어 개발까지, 코드는 AI가 내놓는 결과물이었습니다. 그런데 에이전트가 길고 복잡한 일을 맡기 시작하면서, 코드는 결과물을 넘어 에이전트가 일하는 바탕이 되고 있다는 것이 저자들의 관찰입니다.
저자들은 이 바탕을 하니스(harness)라고 부릅니다. 우리말로 옮기기 까다로운 단어인데, 모델이라는 엔진을 실제로 일하게 만드는 실행 골격, 즉 뼈대에 가깝습니다. 좋은 엔진 하나만으로 자동차가 굴러가지 않는 것처럼, 똑똑한 모델 하나만으로 쓸 만한 에이전트가 되지는 않습니다. 그 사이를 잇는 골격이 필요하고, 논문은 그 골격을 코드가 맡고 있다고 봅니다.
왜 하필 코드가 골격이 되나
저자들이 코드를 골격으로 보는 이유는 코드가 가진 세 가지 성질 때문입니다. 초록의 표현을 빌리면, 코드는 실행되고(executable), 검증되며(verifiable), 상태를 지닙니다(stateful).
쉽게 풀면 이렇습니다. 코드는 말로 끝나지 않고 실제로 돌려 볼 수 있습니다. 돌려 본 결과로 맞는지 틀린지 확인할 수 있습니다. 그리고 중간 상태를 기록해 다음 단계로 이어갈 수 있습니다. 에이전트가 스스로 판단하고 행동하려면 바로 이 세 가지가 필요합니다. 모델이 그럴듯한 문장을 내놓는 데서 그치지 않고, 그 판단을 실행하고 점검하고 이어가게 만드는 토대가 코드라는 것입니다.
저자들이 나눈 세 층위
논문은 이 주제를 세 개의 층으로 나누어 정리합니다. 처음에는 추상적으로 들리지만, 한 번 구조를 잡아 두면 에이전트 기술 전체를 보는 지도가 됩니다.
첫째는 인터페이스입니다. 코드가 에이전트를 추론, 행동, 환경 모델링에 연결하는 층입니다. 복잡한 계산이나 논리는 모델이 머릿속으로 푸는 대신 코드로 떠넘겨 더 정확하게 처리할 수 있습니다(논문은 이를 프로그램에 위임된 추론이라 부릅니다). 행동도 마찬가지로, 에이전트가 할 수 있는 일을 코드, 곧 스킬이나 정책으로 표현합니다. 환경 역시 코드로 나타내고, 실행 흔적을 통해 세계가 어떻게 돌아가는지 모델링합니다.
둘째는 메커니즘입니다. 길고 복잡한 작업을 신뢰성 있게 끌고 가기 위한 장치들입니다. 저자들은 계획 세우기(planning), 기억하기(memory), 도구 쓰기(tool use), 그리고 계획하고 실행하고 검증하는 순환(plan-execute-verify)으로 나눠 정리합니다. 특히 기억은 당장의 작업 기억부터, 의미를 담은 기억, 경험으로 쌓이는 기억, 여러 에이전트가 함께 쓰는 기억까지 세분화합니다. 사람이 일을 잘하려면 계획과 기억과 도구가 필요한 것과 크게 다르지 않습니다.
셋째는 확장입니다. 한 에이전트에서 여러 에이전트로 넓혀 가는 층입니다. 이때 공유된 코드 산출물이 협업과 상호 검토, 검증의 공통 바탕이 됩니다. 사람 여러 명이 같은 코드 저장소를 두고 협업하듯, 에이전트들도 공유된 코드를 매개로 손발을 맞춘다는 그림입니다.
진짜 어려운 문제는 '검증'과 '상태'
이 서베이가 흥미로운 지점은 응용 사례를 넓게 훑는 데서 그치지 않고, 아직 풀리지 않은 숙제를 분명히 짚는다는 데 있습니다. 초록 기준으로 응용 범위는 코딩 보조도구, 화면·운영체제 자동화, 몸을 가진 에이전트(로봇 등), 과학 연구, 개인화·추천, 데브옵스, 기업 업무까지 넓습니다.
그런데 저자들이 남긴 여섯 가지 열린 과제가 제 눈에는 더 중요해 보입니다. 정리하면 이렇습니다. 최종 성공 여부만으로는 부족한 평가 방법, 피드백이 불완전한 상황에서의 검증, 고치다가 오히려 망가지지 않는 개선, 여러 에이전트가 일관된 상태를 공유하는 문제, 안전이 중요한 작업에서의 사람 감독, 그리고 이미지·영상 같은 다양한 환경으로의 확장입니다.
이 목록은 사실상 "에이전트가 실제 업무에 들어가려면 무엇이 더 필요한가"의 목록이기도 합니다. 모델이 답을 한 번 잘 내는 것과, 그 일을 믿고 맡길 수 있는 것은 다른 문제이기 때문입니다.
투자자라면 어디를 볼까
제가 이 서베이에서 가장 크게 가져가는 메시지는, 에이전트의 경쟁력이 모델 하나로 설명되지 않는다는 점입니다. 같은 모델을 쓰더라도 그 위에 어떤 골격을 얹느냐에 따라 결과가 크게 달라질 수 있습니다. 그렇다면 오래가는 가치는 모델뿐 아니라 그 골격, 곧 하니스 층에서도 만들어질 가능성이 높다고 봅니다.
오픈소스 쪽에서도 비슷한 흐름이 보입니다. 예를 들어 Omnigent 같은 프로젝트는 스스로를 메타-하니스라고 부르며, 서로 다른 에이전트 위에 공통 골격을 두려 합니다. 이번 논문은 바로 그 골격이라는 층이 왜 중요한지를 학술적으로 정리해 준 셈입니다. 업계의 제품과 학계의 연구가 같은 곳을 보고 있다는 신호로 읽힙니다.
조심스럽게 덧붙이면, 저는 이 영역을 단순한 개발 편의 도구로만 보지는 않습니다. 검증과 상태 관리, 사람 감독 같은 기능은 기업이 에이전트를 실제 업무에 도입할 때 넘어야 할 문턱입니다. 그 문턱을 낮추는 골격을 잘 만드는 팀이라면, 모델 성능 경쟁과는 다른 자리에서 쉽게 따라잡히지 않는 강점을 쌓을 수 있다고 생각합니다.
한 줄 요약
코드는 이제 AI가 내놓는 결과물을 넘어, 에이전트가 추론하고 행동하고 검증하는 실행 골격(하니스)이 되고 있습니다. 이 서베이는 그 골격을 인터페이스, 메커니즘, 확장이라는 세 층으로 정리하고, 평가와 검증, 사람 감독처럼 남은 숙제를 짚습니다. 제가 가져가는 한 가지는 이렇습니다. 에이전트 시대의 가치는 똑똑한 모델만이 아니라, 그 모델을 믿고 일을 맡길 수 있게 만드는 골격에서 함께 만들어질 가능성이 높습니다.
(이 글은 특정 종목이나 투자에 대한 권유가 아니라, 제 관점을 담은 정보 공유 차원의 글입니다.)