반응형
https://armature.tech/blog/which-tools-coding-agents-install
2026.9.3
[Which tools do Claude Code, Codex and Cursor choose? We measured 16,893 sessions to find out.]
이 보고서는 코딩 에이전트들이 프로젝트에 필요한 외부 도구와 서비스를 어떻게 선택하고 구현하는지 분석한 대규모 실험 결과를 담고 있습니다. 아마추어(Armature) 팀은 약 17,000건의 세션을 통해 Claude Code, Codex, Cursor와 같은 주요 인공지능 도구들이 특정 프로그래밍 언어나 사용자 요구 사항에 따라 어떤 솔루션을 선호하는지 데이터 기반의 리더보드로 정리했습니다. 조사 결과, 결제 분야의 Stripe나 데이터베이스의 Neon처럼 압도적인 선택을 받는 승자가 존재하기도 하지만, 에이전트가 외부 도구 대신 자체 구현(In-house) 방식을 택하는 경우도 빈번하다는 사실이 밝혀졌습니다. 이 연구는 개발자에게는 에이전트의 판단 기준을 이해하는 지표를 제공하며, 서비스 제공업체에게는 AI에 의해 선택받는 도구가 되기 위한 전략적 통찰을 제시하는 것을 목적으로 합니다.

Armature는 Claude Code·Codex·Cursor가 제3자 개발도구를 실제로 어떤 방식으로 선택·설치하는지 실험했다고 주장합니다. 전체 16,893회 실행 중 자체 기준으로 유효하다고 판단한 5,292개 세션을 분석 대상으로 공개했습니다.
- 실험 구성: 75개 합성 저장소, 10개 언어, 4개 사용자 페르소나, 1,163개 프롬프트 변형, 3개 샌드박스 공급자, Claude Code·Codex·Cursor 비교.
- 분석 절차: 에이전트가 도구를 추천·구현하고, Gemini 3.7 Flash가 세션 유효성·언급 제품·최종 선택 제품을 판정.
- 주요 관찰:
신뢰성 평가: 중간 이하 (탐색적 시장 인사이트로는 유용, 일반화된 실증 결론으로는 제한적)
| 평가축 | 판단 | 근거 |
| 표본 규모 | 양호 | 총 실행 수 16,893회, 공개 분석 표본 5,292회는 탐색 연구로는 작지 않습니다. |
| 실험 설계 공개 | 부분 양호 | 저장소·페르소나·샌드박스·판정기 구조를 비교적 구체적으로 설명합니다. |
| 재현성 | 제한적 | “전체 traces 공개”를 주장하지만, 본문 추출 결과에서는 원시 trace, 프롬프트 목록, 판정 기준, 집계 코드로 바로 가는 검증 가능한 링크를 확인하지 못했습니다. |
| 표본 대표성 | 제한적 | 실제 기업 저장소가 아닌, 공개 GitHub 통계를 바탕으로 만든 합성 저장소 75개입니다. 실제 조직의 레거시, 보안정책, 기존 계약, 구매절차, 내부 표준을 충분히 대표한다고 보기 어렵습니다. |
| 판정 타당성 | 낮음~중간 | “유효 세션” 판단과 최종 winner 추출을 Gemini 3.7 Flash가 수행합니다. 사람 간 일치도, 오분류율, 프롬프트·판정 기준, judge 모델의 검증 결과가 제시되지 않았습니다. |
| 선택 과정의 현실성 | 제한적 | simulated human이 항상 1순위안을 채택하거나 에이전트에게 최종 선택을 위임합니다. 실제 조달·보안·법무·운영 담당자의 반대, 기존 벤더 계약, 다기준 의사결정이 빠져 있습니다. |
| 이해상충 | 명확한 주의 필요 | Armature는 개발도구 대상 성장 서비스를 판매하며, 본 연구가 “에이전트에게 제품이 선택되게 하는 방법”을 다루는 사업의 일부라고 직접 밝힙니다. |
| 외부 인용 검증 | 부분 확인 | Vercel의 “코딩 에이전트가 시작한 배포 비율 30% 이상” 인용은 Vercel 원문과 일치합니다. 다만 자사 플랫폼 지표이므로 업계 전체를 대표하는 독립 통계는 아닙니다. |
결론
이 글은 코딩 에이전트 시대의 도구 선택 편향과 맥락 의존성을 보여주는 흥미로운 업계 실험 보고서입니다. 다만 Armature의 사업상 이해관계, 합성 저장소 기반 표본, LLM judge 의존, 독립 재현 자료 확인의 한계 때문에, 마케팅/시장 탐색 자료로는 참고 가능하되 기술·조달 의사결정의 단독 근거로 사용하기에는 부족합니다.
















728x90
반응형
'07.AI > 5. AI 자율성' 카테고리의 다른 글
| 에이전트 AI - 속도 조정 이후, AI 컴퓨팅에 대한 수요와 자본 지출은 계속해서 증가할 것 (0) | 2026.09.21 |
|---|---|
| 하네스 엔지니어링 - Software Factories, Light and Dark (0) | 2026.09.21 |
| 에이전트 AI - TypeSafe AI, Jev : 확률 보정형·타입 안전 의사결정 레이어 (0) | 2026.09.20 |
| 에이전트 AI - Gavel: 혁신적 LLM 라우팅 기술 (0) | 2026.09.20 |
| 에이전트 AI - 재귀적 자기 개선(RSI) 자율성 5단계 개요 및 대표 시스템 (0) | 2026.09.20 |


