반응형

https://arxiv.org/pdf/2609.24974

https://github.com/metaevo-ai/harness-zero

2026.9.21
[Harness-Zero: Harness Distillation via Agent-as-Harness]

Harness-Zero는 거대언어모델(LLM) 에이전트가 외부 시스템인 하네스(harness)에 의존하지 않고도 높은 성능을 낼 수 있도록 돕는 하네스 증류(harness distillation) 프레임워크입니다. 연구진은 특정 도메인에 최적화된 복잡한 하네스의 기능을 모델 자체의 가중치로 내재화하기 위해, 보조 모델이 학생 모델의 행동을 실시간으로 교정하는 에이전트-애즈-하네스(agent-as-harness) 방식을 도입했습니다. 이 방식은 서로 다른 실행 환경 사이의 차이를 극복하며 하네스의 지침을 학생 모델의 행동 공간에 맞는 훈련용 시연 데이터로 변환해 줍니다. 결과적으로 지도 미세 조정(SFT)을 거친 모델은 복잡한 외부 보조 장치를 제거한 상태에서도 기본 모델보다 훨씬 뛰어난 성공률을 보이며, 하네스가 유도했던 정교한 행동 패턴들을 성공적으로 복원해 냅니다.

 

 

핵심 결론: 이 논문은 잘 설계된 에이전트 하네스의 효과를 배포 시 계속 붙여 두는 대신, 학습 과정에서 모델의 행동으로 이전할 수 있는지 검증합니다. 결과는 유망하지만, “하네스가 필요 없어졌다”가 아니라 “특화 하네스의 일부 기능을 모델에 내재화하고, 최소 실행 하네스만 남겼다”로 읽는 것이 정확합니다.[1]

Haoran Ye 외, 「Harness-Zero: Harness Distillation via Agent-as-Harness」, arXiv:2609.24974v1, 2026년 9월 제출. 현재 확인한 것은 arXiv 사전공개본입니다.[2]

 

1. 무엇을 제안했나

하네스는 모델 바깥에서 도구, 실행 흐름, 스킬, 메모리, 검증 규칙을 제공하는 체계입니다. 논문의 문제의식은 특화 하네스가 성능을 높여도 그 효과가 해당 하네스를 배포 환경에 유지해야만 나타난다는 점입니다. 더구나 원래 하네스의 도구·정보와 최종 배포 하네스의 도구·정보가 다르면, 원래 실행 기록을 그대로 모방 학습시키기 어렵습니다.[1, §1·3]

제안 방식은 다음과 같습니다.[1, §3, 그림 1]

  1. 학습 과제의 실패 양상을 분석해 특화 하네스 h\*를 만든다.
  1. 그 규칙을 별도 검토 에이전트가 참고할 K로 변환한다.
  1. 학생 모델은 배포 때 사용할 최소 하네스 h에서 행동을 제안한다. 검토 에이전트는 실행 전에 제안을 통과시키거나, h에서 실행 가능한 완전한 응답으로 고친다.
  1. 이렇게 실제 실행된 학생 관점의 궤적으로 지도 미세조정(SFT)한다. 배포할 때는 h\*, K, 검토 에이전트를 제거하고 h만 사용한다.

차별점은 정답을 잘 내는 교사의 궤적을 단순 복사하는 것이 아닙니다. 학생이 처한 현재 상태에서, 학생에게 실제 허용된 행동으로 교정한다는 점입니다. 검토 에이전트는 숨겨진 정답이나 학생에게 보이지 않는 환경 상태를 볼 수 없도록 제한됩니다.[1, §3.2–3.3]

 

2. 실험 결과는 무엇을 보여주나

비교 논문 보고 결과 해석
기본 Qwen3.5-9B + 최소 하네스 h 23.3% 세 과제의 거시평균 기준선
기본 모델 + 특화 하네스 h\* 41.7% 외부 하네스를 계속 붙인 경우
미세조정 모델 + 최소 하네스 h 44.3% 특화 하네스 제거 후에도 기준선 대비 21.0%p 상승
강한 모델의 추론 시 검토형 하네스 대 코드형 하네스 81.1% 대 78.1% 여섯 벤치마크–모델 조합 평균
하네스 유래 행동 패턴 재현 28개 패턴 평균 82.3% 특정 행동의 출현 여부를 측정

수치는 각각 논문 표 1·2·4에 근거합니다. 과제별로는 미세조정 모델이 SpreadsheetBench 44.0%, AppWorld 58.9%, USPTO 역합성 30.0%를 기록했습니다. 다만 USPTO에서는 특화 하네스를 계속 사용한 기본 모델의 38.0%에 못 미쳤습니다.[1, §4.2–4.5]

 

가장 설득력 있는 실험은 USPTO의 학습신호 비교입니다. 강한 교사의 실행 궤적을 직접 학습해도 평가 점수는 12%였고, 특화 하네스 아래 교사 궤적을 학습하면 3%였습니다. 정답을 알려준 검토 방식은 수집 과제 성공률이 98.6%였지만 학습 후에는 15%에 그쳤습니다. 반면 특화 하네스의 절차를 참조해 학생 행동을 교정한 방식은 30%였습니다. 즉 수집 단계의 정답률보다, 배포 환경에서 재현 가능한 절차를 가르치는 방식이 중요하다는 것이 이 논문의 핵심 실증 주장입니다.[1, 표 3]

 

3. 강점과 해석상의 주의점

강점. 도구 호출법만 가르치는 것이 아니라 “수정 전 조사 → 결과 저장 → 저장본 재열람 → 요구 범위 검증” 같은 업무 절차를 학습 대상으로 삼았습니다. 부록에는 도구를 실행 레시피로, 미들웨어를 검토 조건으로, 스킬·메모리를 진단 기준으로 바꾸는 구체적 매핑이 있습니다. 또한 도메인별 분할, 대조 실험, 행동 패턴 분석을 함께 제시합니다.[1, §3–4·부록 B]

 

주의할 점은 네 가지입니다.

  • ‘하네스 제거’는 문자 그대로가 아닙니다. 배포 시에도 Bash 실행 도구가 있는 최소 하네스 h는 남습니다. 컨텍스트 관리처럼 학생 응답만으로 표현하기 어려운 기능도 저자들이 한계로 인정합니다.[1, §5·부록 E.1]
  • 44.3%는 높은 절대 성공률이 아닙니다. 23.3%에서 크게 개선됐지만, 평가 과제에서 절반 이상은 여전히 실패합니다. 세 도메인의 지표도 SpreadsheetBench·USPTO의 과제 성공률과 AppWorld의 시나리오 목표 달성률을 평균한 것이므로, 단일 운영 성공률처럼 읽으면 안 됩니다.[1, §4.1, 표 2]
  • 행동 재현 82.3%는 정답률이 아닙니다. 하네스에서만 관찰됐던 행동을 궤적 탐지기로 골라, 미세조정 모델에서도 나타나는지 측정한 평균입니다. 예컨대 “변경 후 다시 읽기” 행동의 재현이 그 변경의 정확성을 자동으로 보증하지는 않습니다.[1, §4.5·부록 G]
  • 검토 에이전트의 역량과 비용에 의존합니다. 약한 모델이 검토자까지 맡으면 교정이 오히려 해로웠고, USPTO에서 매 행동을 검토한 실행 시간은 기본 방식의 약 2.4배였습니다. 이 비용은 데이터 수집 단계의 비용이며, 미세조정 후 배포 추론에는 같은 검토 루프가 필요하지 않습니다.[1, §5·부록 F]

논문에 제시된 점수는 단일 실행 평가이며, 본문에 반복 실행에 따른 변동폭이나 신뢰구간은 제시되지 않습니다. 따라서 특화 하네스 대비 44.3% 대 41.7%의 작은 우위를 보편적 우월성으로 단정하기보다, 이 실험 조건에서 특화 하네스를 제거하고도 성능을 유지·개선했다는 증거로 보는 편이 타당합니다.[1, §4.1, 표 2]

 

4. 실무적 시사점

에이전트 운영 관점에서 우선 내재화할 후보는 조사·검증·재확인·실패 복구처럼 반복 가능하고 학생의 도구로 실행 가능한 절차입니다. 반면 권한 통제, 강제 차단, 외부 상태 보존, 안전 검증을 모델이 학습했다는 이유만으로 제거해서는 안 됩니다. 이 논문의 미들웨어 행동 재현은 유용한 관찰 결과이지, 결정적 통제의 대체를 입증한 결과는 아닙니다.[1, §4.5·§5]

한 줄 평가: Harness-Zero는 하네스 최적화 결과를 배포 가능한 모델 역량으로 환원하는 방법을 보여준 논문입니다. 가장 중요한 기여는 성능 숫자 자체보다, 서로 다른 하네스의 행동 공간을 학생의 실제 실행 공간으로 번역한 뒤 학습한다는 설계 원칙입니다.[1]

 

Sources

[1] 논문 PDF — Harness-Zero: Harness Distillation via Agent-as-Harness
[2] arXiv 서지·버전 정보

 

728x90
반응형
Posted by Mr. Slumber
,