07.AI/7. AI 벤치마크

에이전트 AI - 벤치마크 - ReFigBench: 파워포인트(PPTX) 슬라이드로 자동 재구성하는 멀티모달 코딩 에이전트 평가

Mr. Slumber 2026. 10. 4. 23:55
728x90
반응형

https://arxiv.org/pdf/2609.18844

2026.9.16
[ReFigBench: Benchmarking Scientific Figure Reconstruction as Editable PowerPoint Artifacts]

제시된 문헌은 과학 논문의 개요 그림(Scientific Overview Figure)을 시각적 유사성과 편집 가능성을 모두 갖춘 파워포인트(PPTX) 슬라이드로 자동 재구성하는 멀티모달 코딩 에이전트를 평가하기 위한 새로운 벤치마크 프레임워크인 ReFigBench를 소개하고 있습니다. 본 문헌은 기존 평가들이 단순한 픽셀 비교나 텍스트 지시사항 준수 등에 그쳐 모델의 시각적 이해력, 에이전트의 실행 능력, 그리고 도구와 환경을 제공하는 하네스(Harness)의 상호작용을 제대로 분리해내지 못한다는 한계를 지적하며, 1,000개의 실제 아카이브(arXiv) 논문 그림을 바탕으로 한 객관적인 데이터셋 구축 과정과 평가 체계를 상세히 설명합니다. 특히, 모델의 성능과 하네스 환경이 작업 효율성에 미치는 복합적인 영향, 그리고 직접 코드 생성 방식과 특화된 PPTX 워크플로우 간의 비교를 통해 정교한 워크플로우가 오히려 네이티브 연결선과 문서 구조(편집 가능성)를 훼손한다는 핵심적인 트레이드오프를 밝혀내고 있습니다. 최종적으로 이 연구는 시각적 충실도와 문서의 구조적 편집 가능성을 동시에 달성하는 것이 실용적인 멀티모달 문서 에이전트 개발에 있어 가장 중요한 도전 과제임을 강조합니다.

 

 

 

「ReFigBench: Benchmarking Scientific Figure Reconstruction as Editable PowerPoint Artifacts」 v1입니다. 논문은 본문 1~7장과 부록 A~O로 구성됩니다. 핵심 질문은 “원본 도식을 닮은 PPTX”와 “의미가 정확하고 실제로 편집 가능한 PPTX”를 어떻게 함께 평가할 것인가입니다.[1, pp. 1–3]

먼저 보는 전체 구조

장 다루는 질문 핵심 산출
1. 서론 왜 기존 평가로는 부족한가? 시각적 충실도와 문서 구조의 이중 요건
2. 관련 연구 기존 벤치마크와 무엇이 다른가? 실물 PPTX 산출물·객체 구조 평가의 차별점
3. ReFigBench 데이터와 평가 기준을 어떻게 만들었나? ORBIT 데이터셋, 산출물 계약, 5축 점수
4. 실험 설정 무엇을 통제하고 비교했나? 10개 모델–하네스–작업 방식 구성
5. 결과·분석 어디서 성능이 갈렸나? 하네스 효과, 연결선 소실, 평가자 비교
6. 한계 어디까지 일반화할 수 있나? 단일 슬라이드·분야 편중·평가자 의존성
7. 결론 실무에 남는 메시지는? 렌더링과 기본 객체 구조를 함께 검증

1장. 서론 — 문제를 ‘그림 복제’가 아닌 ‘문서 재구성’으로 정의

저자들은 과학 도식에 있는 상자, 화살표, 반복 기호가 연구 방법의 관계를 표현한다고 봅니다. 이미지로 발행된 도식을 PPTX로 되살리려면 픽셀뿐 아니라 텍스트 상자·도형·연결선·읽기 순서도 복원해야 합니다. 원본 이미지를 슬라이드에 붙이면 화면은 정확하지만 편집할 수 없고, 반대로 객체를 많이 만들어도 화살표가 거꾸로 향하면 연구 내용이 틀립니다. 논문의 그림 1은 이 두 실패를 구분합니다.[1, pp. 1–2]

분석: 이 장의 기여는 평가 대상을 모델의 답변이나 스크린샷이 아니라 사용자가 넘겨받아 수정할 PPTX 산출물로 바꾼 데 있습니다. 또한 실패 원인을 모델의 시각 인식, 에이전트 수행 능력, 하네스의 작용으로 나누어 묻습니다. 다만 세 원인을 이 단계에서 독립적인 변수로 완전히 분리한 것은 아니며, 이후 실험이 그 차이를 부분적으로 좁혀 갑니다.[1, pp. 2–3]

2장. 관련 연구 — 기존 평가의 빈틈을 특정

논문은 기존 연구를 크게 세 갈래로 비교합니다. PPTC·PPTAgent 등은 주로 텍스트나 문서 지시에서 슬라이드를 만들고, Design2Code·ChartMimic 등은 이미지에 대한 렌더링 유사성을 평가하며, SWE-bench 계열은 최종 산출물 평가의 선례를 제공하지만 PPTX의 시각·편집 구조는 다루지 않습니다. ReFigBench는 실제 과학 도식만을 입력으로 주고, 단일 PPTX 파일을 받아 렌더링과 내부 객체를 함께 검사한다고 차별화합니다.[1, pp. 3, 16–17]

분석: 차별점은 설득력 있습니다. 다만 이 비교는 “기존 연구보다 모든 면에서 더 어렵다”는 증명이 아니라, 입력·산출물·평가 항목의 조합이 다르다는 범위 규정으로 읽는 것이 정확합니다.

3장. ReFigBench — 데이터셋과 채점 체계

① 산출물 계약. 에이전트는 원본 도식 한 장을 읽고 슬라이드 한 장이 담긴 PPTX와 생성 코드를 제출합니다. 파일이 없거나, 열리지 않거나, 슬라이드가 여러 장이거나, 렌더링되지 않으면 0점입니다. 통과한 결과물은 렌더링 이미지와 PPTX 내부 객체 트리를 모두 검사합니다.[1, pp. 4–5]

② ORBIT 데이터 구축. 저자들은 arXiv의 cs.AI, cs.CL, cs.CV, cs.LG 분야에서 캡션의 overview·framework·architecture·pipeline·method 등의 신호로 개요 도식을 찾았습니다. 엄격한 선별을 통과한 5,146개 가운데 재현 가능한 순서로 서로 다른 논문에서 한 개씩, 총 1,000개를 선정했습니다. arXiv 버전, 캡션, 원본 경로, 라이선스, 선택 근거, 해시를 기록합니다. 저자들이 보고한 수동 검토에서는 선별 도식의 98%가 실제 개요 도식이었습니다. 최종 표본은 cs.CV가 464개, cs.AI가 81개로 분야별 균형 표본은 아닙니다.[1, pp. 4–5, 17–18]

③ 평가 척도. 점수는 텍스트 정확성 20점, 의미 구조 30점, 배치 15점, 기본 객체의 편집 가능성 25점, 시각적 세부사항 10점을 합합니다. 슬라이드 면적의 85% 이상을 한 이미지가 차지하면서 기본 객체가 적으면, 원본 이미지를 붙여 넣은 것으로 간주해 최대 50점으로 제한합니다. 동일한 원본에 대한 특화 방식 점수 − 직접 작성 방식 점수를 대응 비교하고, 사람 평가에는 원본·익명 렌더링·간략 객체 검사를 제시합니다.[1, pp. 5–6]

분석: 의미 구조에 가장 큰 가중치를 준 것은 화살표 하나가 계산 흐름을 바꿀 수 있다는 문제 정의와 일치합니다. 반면 가중치 20/30/15/25/10은 저자들이 정한 평가 정책입니다. 따라서 총점만 보지 말고 축별 점수와 객체 검사 결과를 함께 읽어야 합니다.

4장. 실험 설정 — 모델뿐 아니라 하네스와 작업 방식을 비교

Claude Opus 4.6, MiMo-v2.5, MiniMax-M3는 Claude Code에서, GPT-5.5는 Codex와 Claude Code에서 실행했습니다. 각 모델–하네스 조합에 직접 python-pptx 코드를 쓰는 방식과 PPTX 특화 도구를 쓰는 방식을 적용해, 동일한 1,000개 도식에서 10개 구성·10,000개 PPTX를 만들었습니다. 논문에 따르면 10,000개 모두 파일·슬라이드·렌더링 기본 관문은 통과했습니다.[1, pp. 6, 19–21]

자동 평가는 고정된 GPT-5.4 판정 모델로 세 차례 수행하고, 다른 계열인 Qwen3.6-27B로도 세 차례 반복했습니다. 사람 평가는 원본 도식 993개에 걸친 유효 비교 4,270건입니다. GPT-5.5의 두 하네스 직접 작성 방식에는 동일한 지시문을 사용했으므로, 이 비교가 논문에서 가장 선명한 하네스 비교입니다.[1, pp. 6–7, 19–20]

분석: 작업 방식 비교는 실무자가 선택하는 전체 도구체인의 효과를 측정합니다. 특화 방식의 프롬프트·스킬 구현·라이브러리 차이가 함께 포함되므로, 결과를 특정 라이브러리 하나의 인과효과로 해석해서는 안 됩니다.[1, p. 11]

5장. 결과와 분석 — 논문의 핵심

첫째, 특화 방식의 효과는 모델·하네스 조합마다 달랐습니다. 아래 값은 같은 원본 도식에 대한 특화 방식 − 직접 작성 방식의 평균 점수 차이입니다.[1, pp. 8–9, 23]

모델·하네스 점수 차이 95% 신뢰구간 해석
Claude Opus 4.6 · Claude Code −3.05 [−3.48, −2.61] 특화 방식 하락
MiMo-v2.5 · Claude Code −2.41 [−3.05, −1.74] 특화 방식 하락
MiniMax-M3 · Claude Code +0.04 [−0.63, +0.73] 뚜렷한 차이 없음
GPT-5.5 · Codex +3.16 [+2.46, +3.87] 특화 방식 상승
GPT-5.5 · Claude Code −2.21 [−2.76, −1.63] 같은 모델인데 특화 방식 하락

동일한 직접 작성 지시문에서는 GPT-5.5가 Claude Code에서 Codex보다 약 1.4점 높았습니다. 따라서 “GPT-5.5의 성능”처럼 모델명만 표시한 비교보다 모델 + 하네스 + 작업 방식을 명시한 비교가 정확합니다.[1, pp. 8, 23]

둘째, 특화 방식은 텍스트 점수를 올렸지만 편집 구조를 약화했습니다. 다섯 조합 모두 텍스트 정확성 점수는 상승하고 편집 가능성 점수는 하락했습니다. 특히 특화 방식 산출물은 기본 연결선 객체의 중앙값이 다섯 조합 모두 0개였고, 연결선이 전혀 없는 비율은 91.8~100%였습니다. 직접 작성 방식의 중앙값은 15~42개입니다. 이는 관계선이 화면에는 보여도 PPTX의 연결선 객체로 남지 않아, 상자를 움직였을 때 관계를 따라 수정하기 어려울 수 있음을 뜻합니다. 연결선 0개를 ‘모든 객체가 편집 불가’로 확대해서는 안 됩니다.[1, pp. 8–10, 23–24]

셋째, 평가 방식에 따라 선호가 갈렸습니다. GPT-5.5·Codex의 특화 방식이 자동 루브릭 최고점 77.4점을 기록했습니다. 자동 점수와 사람 평가의 전체 구성 순위는 높은 상관을 보였지만, 사람 평가는 다섯 조합 중 네 조합에서 특화 방식의 렌더링을 더 선호했습니다. 근접한 결과에서는 시각적 인상과 내부 편집 구조에 부여하는 무게가 다릅니다. 결정적인 사람 선택에 대한 자동 판정의 방향 일치율은 72.4%였으며, 점수 차가 작은 사례의 일치율은 낮았습니다.[1, pp. 9–11, 25–26]

넷째, 둘 중 하나만 검사해도 실패합니다. 사례 연구의 PPTX는 기본 텍스트·도형·연결선을 풍부하게 갖춰 편집 가능성 22/25점을 받았지만, 거의 모든 화살표가 반대로 향해 의미 구조는 10/30점이었습니다. 렌더링 유사성, 객체 수, 합계 점수 각각을 단독 합격 기준으로 삼으면 놓칠 수 있는 오류입니다.[1, pp. 10, 24]

6장. 한계 — 결과를 적용할 때의 경계

저자들이 명시한 범위는 과학 논문의 단일 페이지 개요 도식입니다. 전체 발표자료나 애니메이션에 결과를 바로 일반화할 수 없습니다. 원본도 네 AI 분야에서 모았고 분야별 할당량이 없어 cs.CV 비중이 큽니다. 자동 점수는 루브릭과 판정 모델에 의존하며, GPT 계열 판정 모델이 GPT 계열 생성 결과를 채점한다는 우려도 있습니다. 저자들은 반복 판정·Qwen 판정·사람 비교·가중치 민감도 분석으로 이를 점검했지만, 개별 산출물의 근소한 점수 차이까지 확정해 주지는 않습니다.[1, pp. 11, 26–28]

추가로, 두 하네스의 직접 비교는 GPT-5.5 한 모델에 한정됩니다. “모든 모델에서 Claude Code가 Codex보다 낫다”는 결론은 이 연구에서 나오지 않습니다.[1, p. 11]

7장. 결론 — 무엇을 평가 대상으로 삼아야 하는가

저자들의 결론은 세 층입니다. 원본을 읽는 능력이 정확도의 상한을 만들고, 모델과 하네스의 결합이 추가 작업의 효용을 좌우하며, 제작 작업 방식이 PPTX 내부 구조의 보존 여부에 영향을 줍니다. 최고 구성도 100점 만점에 77.4점입니다. 따라서 좋은 렌더링 이미지 한 장은 충실하고 편집 가능한 문서가 완성됐다는 증거가 아닙니다.[1, p. 13]

부록 A~O: 본문 결론을 검증하는 자료

부록 핵심 내용 읽을 때의 가치
A–C 기존 벤치마크 비교, ORBIT 수집 절차·출처 기록, 원본 이미지 통계 데이터가 어떻게 선정됐는지 확인
D–F Docker 환경, 제출 형식, 생성·자동 판정·사람 판정 지시문 재현 가능성과 비교 조건 확인
G–I 전체 점수·분야별 결과, 객체 감사, 화살표 역전 사례 평균점수 뒤의 실패 유형 확인
J–K 사람 선호 Elo, 자동 판정과 사람 판정의 사례별 일치도 순위와 개별 판정의 차이 확인
L–M 판정 모델 반복·교체, 루브릭 가중치 변경 결과의 민감도 확인
N–O 토큰·시간·비용, 라이선스·출처 정책 운영 비용과 재사용 조건 확인

특히 부록 M에서는 편집 가능성의 배점을 바꿔도 전체 순위가 대체로 유지되는지 검사합니다. 부록 N에 따르면 특화 방식의 비용은 조합에 따라 직접 작성 대비 약 1.4~3.5배이며, Codex 비용은 실제 청구액이 아닌 보수적인 추정 상한입니다. 논문은 데이터·코드의 공개 계획도 설명하지만, 해당 서술만으로 공개가 이미 완료됐다고 볼 수는 없습니다.[1, pp. 20, 28–31]

종합 평가 및 적용 포인트

이 논문의 가장 강한 메시지는 평가 단위를 ‘보기 좋은 이미지’에서 ‘의미와 객체 구조를 가진 파일’로 확장해야 한다는 것입니다. PPTX 생성 시스템을 검수한다면 최소한 다음을 분리 판정하는 구성이 적절합니다.

  • 내용: 원본 텍스트와 수치·기호가 맞는가
  • 의미: 화살표 방향, 모듈 간 관계, 계층이 맞는가
  • 표현: 위치·가독성·시각적 세부사항이 적절한가
  • 편집성: 텍스트·도형·연결선이 필요한 수준으로 기본 객체로 남는가
  • 운영성: 동일 품질을 얻는 데 걸린 시간과 비용이 수용 가능한가

이는 논문 결과를 검수 절차로 옮긴 실무 제안입니다. 논문 자체가 모든 업무용 PPTX에 공통으로 적용할 합격점이나 연결선 최소 개수를 정한 것은 아닙니다.[1]

Sources

[1] https://arxiv.org/pdf/2609.18844v1 — Fan et al., ReFigBench: Benchmarking Scientific Figure Reconstruction as Editable PowerPoint Artifacts, v1, 본문 및 부록.

 

728x90
반응형