블로그하네스·Pi8분 읽기

같은 모델을 물리고 하네스만 바꿨더니 한쪽은 $9.28, 한쪽은 $35.37을 냈다

Kimi K3 하나를 물린 하네스 8개가 API 비용을 $9.28부터 $35.37까지 썼어요.

같은 모델을 물리고 하네스만 바꿨더니 한쪽은 $9.28, 한쪽은 $35.37을 냈다 대표 이미지

AI 코딩 도구를 고를 때 많은 분이 모델 얘기에서 멈춥니다. 소네트냐, GPT냐, Kimi냐. 자동차로 치면 엔진 배기량만 놓고 차를 고르는 셈이죠. 같은 엔진이라도 연비를 보려면 차체와 변속기까지 봐야 하는데 말이에요.

Composio가 모델을 Kimi K3 하나로 고정하고 하네스만 여덟 개로 바꿔 돌린 벤치마크를 공개했습니다. 같은 태스크 묶음에 하네스마다 API 비용을 $9.28부터 $35.37까지 썼어요. 가장 많이 쓴 하네스는 Claude Code였습니다.

숫자를 순서대로 놓고, 그 숫자를 어디까지 믿어도 되는지까지 정리했습니다.


1. 같은 엔진, 주유비는 $9.28부터 $35.37까지

용어부터 맞출게요. 모델이 엔진이라면 하네스는 차체와 변속기입니다. 토큰은 연료, API 비용은 주유비, 런타임은 랩타임에 해당해요.

측정한 곳은 Composio입니다. MCP 도구 인프라를 파는 회사이고, 벤치마크 태스크도 MCP 기반으로 짰어요. 자사 이해가 걸린 태스크로 측정한 기록이라는 점을 먼저 알고 읽어야 합니다.

벤치마크를 인용한 개발자 Aarno가 트윗으로 이 숫자를 퍼뜨렸습니다.

"하네스가 해자다(the harness is the moat)."

Aarno(@TheGlobalMinima)의 주장입니다. 다만 그는 Pi 사용자이자 옹호자예요. 한쪽 진영의 주장으로 읽는 편이 안전합니다.

벤치마크 조건은 단순합니다. 모델은 Kimi K3 한 종, 전부 OpenRouter 경유, 하네스만 여덟 개로 교체했어요. 태스크는 비즈니스 앱 워크플로 25개이고, 코딩 벤치마크는 아닙니다. 그래서 아래 표는 같은 엔진을 물렸을 때 어느 하네스가 연료를 더 쓰는지 보여 주는 기록에 가깝습니다.

하네스토큰총 API 비용
Pi Agent7.59M$9.65
Codex9.19M$11.28
OpenCode9.50M$12.29
Oh My Pi9.65M$10.93
Hermes Agent10.09M$9.28
Grok Build12.62M$11.87
Claude Code15.09M$35.37
Kimi Code15.27M$12.87

토큰과 비용은 24개 태스크 기준. Composio 측정치.

토큰 사용량과 API 비용을 나란히 세운 막대 차트. 토큰 최소는 Pi Agent, 비용 최대는 Claude Code

속도로 줄 세워도 양 끝은 연료 순서와 같아요. 중앙값 런타임 최단은 Pi Agent 156.2초, 최장은 Claude Code 330.5초예요. 중간 순위까지 같지는 않았습니다. 엔진도 과제도 같았는데 하네스마다 토큰을 크게 다르게 썼어요. 성능보다 낭비 구조를 봐야 하는 이유입니다.

연료 소비만 보면 Pi Agent를 고르고 싶어집니다. 통과율 표까지 같이 봐야 제대로 고를 수 있어요.


2. 통과율 순위: Oh My Pi 88%, Pi Agent 72%

싼 쪽이 곧 좋은 쪽이라고 읽으면 곤란합니다. 절약 순위와 통과율 순위를 겹쳐 보면 1등이 서로 다른 하네스예요.

하네스통과율통과 수
Oh My Pi88%22/25
Kimi Code84%21/25
Hermes Agent80%20/25
Claude Code76%19/25
Pi Agent72%18/25
OpenCode72%18/25
Grok Build72%18/25
Codex68%17/25

통과율은 25개 태스크 기준. 앞의 토큰·비용 표(24개 태스크)와 태스크 수가 달라요.

태스크 수가 달라서 두 표를 한 문장에서 곱하거나 나누면 안 됩니다. 따로 읽어야 해요. 토큰을 가장 적게 쓴 Pi Agent는 통과율 72%로 OpenCode·Grok Build와 함께 공동 5위입니다. 비용을 가장 많이 쓴 Claude Code는 통과율 76%로 4위에 올랐어요. 통과율 1위 Oh My Pi는 88%를 찍었고, 토큰과 비용은 여덟 하네스의 중간 언저리에 있었습니다.

성공 건당 비용으로 다시 줄 세워 볼게요. Hermes Agent $0.46, Oh My Pi $0.52, Pi Agent $0.57, Claude Code $1.96. 토큰을 가장 아낀 Pi Agent가 성공 한 건당으로는 Oh My Pi에 밀립니다.

도구 호출 수는 Pi Agent 223회, Claude Code 293회, Grok Build 402회였어요. 호출을 많이 던진 하네스가 더 많이 맞히지는 못했습니다.

이름 때문에 자주 엉키는 대목도 하나 있어요. Oh My Pi와 Pi Agent는 서로 다른 하네스입니다. 통과율 1위는 Oh My Pi, 토큰 최소는 Pi Agent죠. 둘을 한 덩어리로 묶으면 "미니멀 하네스가 1등"이라고 잘못 읽게 됩니다.


3. 하네스를 다섯 층으로 뜯어 보면

하네스를 기능 체크리스트로만 보면 어디서 달라지는지 잡기 어렵습니다. 다섯 층으로 뜯어 보면 하네스마다 어디서 연료를 더 쓰는지 알 수 있어요. 가운데 모델이 앉고, 그 둘레를 다섯 층이 감싸는 구조입니다.

  • 맥락 주입: 프롬프트, 메모리, 스킬
  • 제어: 압축, 오케스트레이션, ralph 루프
  • 행동: 배시, 도구, MCP
  • 영속: 파일 시스템, 깃, 진행 기록 파일
  • 관측과 검증: 브라우저 스크린샷, 테스트 결과, 로그

모델을 가운데 두고 맥락 주입·제어·행동·영속·관측과 검증 다섯 층이 감싸는 하네스 구조도

같은 다섯 층이라도 하네스마다 다르게 채웁니다. 층마다 무엇을 얼마나 컨텍스트에 밀어 넣느냐에 따라 하네스가 태우는 연료량도 다릅니다. 다수의 하네스는 다섯 층을 통째로 내장합니다.

Pi는 반대로 갑니다. 최소한만 남기고 나머지는 익스텐션과 스킬로 갈아 끼워요. MCP 서버 연결은 pi-mcp-adapter, 웹 브라우징은 pi-web-access, 코드베이스 지식 그래프는 graphify-pi가 맡습니다. 세션 요약은 session-recap, 계획 검증은 grill-me, 스킬 제작은 skill-creator 몫이에요.

오케스트레이션 층에는 Herdr를 씁니다. 제품 소개 문구는 이렇습니다.

"에이전트를 염두에 두고 만든 터미널 멀티플렉서(a terminal multiplexer specifically built with agents in mind)."

제품 측 서술이라 그대로 받을 말은 아닙니다. Herdr는 영속 세션과 워크스페이스 관리, 그리고 백그라운드 서브프로세스 없는 에이전트 오케스트레이션을 내세워요. tmux나 screen이 사람용 다중 창이라면, Herdr는 에이전트용 다중 창을 표방합니다.

spaces·agents 사이드바와 orchestrator·리서치·vim·터미널 탭이 함께 열린 Herdr 작업 화면

연료 절감을 직접 겨냥한 조각은 caveman 스킬입니다. 스킬 제작자는 토큰을 65% 줄인다고 표방해요. 다만 65%는 Composio 벤치마크와 무관한 별개 출처의 자체 표방치입니다. 앞선 표의 7.59M과 나란히 놓고 더하거나 비교할 근거는 없어요.

모델 공급 쪽에서는 Opencode Go를 월 $10에 구독해 DeepSeek v4-flash, v4-pro, GLM에 접근하는 구성을 씁니다. 셋업을 공유한 당사자도 Claude Pro를 함께 결제해 병용한다고 밝혔어요.


4. 이 숫자를 어디까지 믿을까요?

먼저 짚을 사실이 하나 있습니다. Composio가 여덟 하네스를 줄 세운 태스크는 코딩 과제가 아니에요. Gmail, Calendar, Sheets, GitHub, Slack, Notion, Linear, PagerDuty를 오가는 비즈니스 앱 워크플로입니다. 리팩터링이나 버그 추적, 대형 코드베이스 탐색 능력은 측정하지 않았다는 뜻이죠. "코딩 성능 순위"로 옮겨 적으면 그 순간 사실 오류가 됩니다.

Composio도 원문에서 한계 다섯 가지를 스스로 인정했어요.

한계내용
단일 모델Kimi K3 하나로만 측정, 각 하네스의 네이티브 모델 성능 미반영
1회 실행태스크당 한 번씩만 돌려 안정성과 재현성 미검증
태스크 성격비즈니스 앱 MCP 과제, 코딩 벤치마크와 다름
비용 산정OpenRouter 리스트 가격 기반 추정치, 실제 청구와 다를 수 있음
미평가 항목UI, 설치 편의성 등 제품 기능

한계 목록에 하나를 더 얹어야 합니다. 측정 주체와 이해관계예요. MCP 인프라를 파는 회사가 MCP 태스크로 하네스를 줄 세웠고, Composio가 내놓은 순위도 자사 도구 생태계의 쓸모를 거드는 쪽입니다.

원 트윗을 쓴 Aarno도 Pi 사용자이자 옹호자예요. 자기 셋업을 공개한 글이고, 제3자 검증은 없습니다.

숫자의 성격도 짚고 넘어갈게요. $9.28과 $35.37은 실제 청구서 금액이 아니고, 리스트 가격으로 환산한 추정치입니다. 태스크당 한 번씩만 돌렸으니 같은 조건에서 다시 돌려도 순위가 유지된다는 보장은 없어요. 서킷에서 한 바퀴 돌아 나온 랩타임에 가깝습니다.

그래도 남는 결론은 있습니다. 같은 엔진을 얹고도 하네스마다 토큰을 7.59M부터 15.27M까지 썼어요. 모델을 갈아타기 전에 하네스부터 비교해 보세요.


참고

FAQ

자주 묻는 질문

하네스가 뭔가요?
모델을 감싸는 환경 전부예요. 프롬프트, 도구 연결, 컨텍스트 관리, 오케스트레이션 같은 것들이요. 같은 모델이라도 하네스에 따라 태우는 토큰과 비용이 달라져요.
이 벤치마크를 그대로 믿어도 되나요?
조심해야 해요. 측정한 곳이 MCP 인프라를 파는 Composio라서, 자사 이해가 걸린 태스크로 돌린 기록이에요. 태스크당 한 번만 돌렸고, 비용도 리스트 가격 추정치예요. 다만 같은 엔진을 쓰고도 하네스에 따라 연료를 두 배 넘게 더 태웠다는 사실 자체는 유효해요.
Pi Agent와 Oh My Pi는 같은 건가요?
아니에요, 서로 다른 하네스예요. 토큰 최소는 Pi Agent(7.59M)이고, 통과율 1위는 Oh My Pi(88%)예요. 이름이 비슷해서 자주 헷갈리는데, 한 덩어리로 묶으면 틀린 결론을 내리게 돼요.
원고, 봉투, 책자가 오렌지 리본 하나로 이어진 모습

SEASON 3

시즌3 「콘텐츠로 팔기」

AI와 콘텐츠를 만들고 고객에게 연결하는 4주

제가 에이전트로 조사하고 쓰고 파는 과정을 그대로 보여 드려요. 그다음 각자의 주제로 같이 만들어 봐요.

10월 2일 OT · 10월 5일부터 월·수 4주 · 10월 31일 오프라인

시즌3 커리큘럼 보기