반응형

https://www.orcarouter.ai/blog/grok-4-7-vs-grok-4-6

https://llm-stats.com/models/grok-4.7

https://media.x.ai/v1/website/4p7card-5eccc980.pdf

2026.9.21
[ Model Card: Grok 4.7 ]

이 문서는 SpaceXAI(xAI)가 개발한 최신 인공지능 모델인 Grok 4.7의 성능과 안전성을 상세히 기록한 모델 카드입니다. 이전 버전을 개선한 이 모델은 특히 코딩, 공학 설계, 전문 사무 업무 분야에서 높은 자율성을 바탕으로 복잡하고 장기적인 과업을 수행하는 데 최적화되었습니다. 본문은 다양한 벤치마크 지표를 통해 Grok 4.7이 법률 및 의료 분석과 같은 지식 집약적 작업에서 보여주는 탁월한 역량과 더불어, 생화학 및 사이버 보안 분야의 위험을 관리하는 엄격한 안전 보호 체계를 심도 있게 다룹니다. 궁극적으로 이 자료는 모델의 기술적 한계를 객관적으로 명시함으로써, 과학 연구와 인프라 강화 등 정밀한 전문 분야에서의 정당한 활용을 장려하고 있습니다.

 

핵심 판단: 이 문서는 Grok 4.7의 장시간 코딩·에이전트 작업 성능 향상을 비교적 구체적으로 제시합니다. 다만 벤치마크마다 추론 강도와 에이전트 실행 환경이 달라, 표에 나란히 놓인 점수를 곧바로 모델 간 우열이나 실제 업무 성공률로 해석해서는 안 됩니다. 아래 수치는 모두 첨부 모델카드의 보고값이며, 독립 재현 결과로 검증한 값은 아닙니다. (PDF 4~5, 8~12쪽)

 

주요 결과

영역 문서상 Grok 4.7 결과 해석
DeepSWE v1.1 71.0%, 4.6 대비 +5.8%p 저장소 수준 코딩 과제에서 개선. 동일한 mini-SWE-agent 환경과 독립 검증 절차를 설명합니다. (8쪽)
Terminal-Bench 4.0 38.0%, 4.6 대비 +17.7%p 큰 폭의 차이지만 4.7은 xhigh, 4.6은 high로 추론 강도가 다릅니다. 실행 환경의 영향도 문서가 인정합니다. (9쪽)
SWE-Marathon v1.1 46.0%, 4.6 대비 +14.1%p 다시간 과제의 전체 검증 통과율. 각 모델의 고유 에이전트 환경을 사용하므로 ‘모델 단독 성능’은 아닙니다. (11쪽)
Legal Agent Benchmark 19.6%, 4.6 대비 +3.8%p 비교군 중 높지만 절대 통과율은 낮습니다. 법률 업무의 무인 자동화 근거로 쓰기 어렵습니다. (12쪽)
HealthBench Professional 56.7%, 4.6 대비 +8.2%p 개선은 보고됐으나 평가 모델과 타사 점수의 출처가 서로 달라 비교에 주의가 필요합니다. 의료 고위험 의사결정에는 전문가 검증을 요구합니다. (4, 15쪽)

 

안전성과 신뢰성에서 주목할 점

  • 개선만 있었던 것은 아닙니다. 일반 유해 요청 compliance는 4.6의 0.93% → 4.7의 1.10%, 자해 관련 compliance는 0.84% → 1.05%입니다. 두 지표 모두 낮을수록 좋은 평가이므로 보고값상 후퇴입니다. 특히 본문은 자해 관련 “compliance가 높아졌다”고 기술하는데, 이를 안전성 개선으로 읽으면 안 됩니다. (24, 26쪽)
  • 생물학 분야는 능력과 거부 성능을 분리해야 합니다. ProtocolQA는 79.6% → 70.4%, BixBench는 93.8% → 88.4%로 내려간 반면, 고위험 생물학 요청에 대한 거부율은 90.7% → 91.4%입니다. 지식·문제해결 점수 하락을 곧바로 안전성 향상으로 등치할 수 없습니다. (21~23쪽)
  • 사이버 역량의 방향도 단일하지 않습니다. CyberGym의 취약점 재현율은 79.7% → 80.3%로 소폭 상승했지만, CVE-Bench의 high 결과는 39.8% → 37.7%입니다. 시험 대상과 지표가 달라 “공격 역량이 전반적으로 상승했다”는 결론은 과도합니다. (17~18쪽)

 

[확인 필요] 도입·조달 관점의 검증 항목

  1. 동일 조건 재평가: 모델별 추론 강도, 에이전트 실행 환경, 도구 접근권, 시간·비용 한도를 맞춘 비교가 필요합니다. 특히 Terminal-Bench와 SWE-Marathon 결과는 실행 환경의 영향을 명시합니다. (9, 11쪽)
  1. 재현성 자료: 내부 안전성 평가의 문항 수·표본 구성·신뢰구간·판정 오류, 외부 평가의 실행 설정과 원시 결과를 요청해야 합니다. 작은 백분율 차이의 의미는 이 정보 없이는 판단하기 어렵습니다. (18, 23~27쪽)
  1. 운영 통제: 실제 배포 채널에 따라 추가 입력·주제 필터가 적용될 수 있다고 설명합니다. 따라서 모델카드 점수뿐 아니라 사용할 API·제품 채널에서의 거부 동작, 로그, 인간 승인 절차를 시험해야 합니다. (24쪽)
  1. 고위험 사용 제한: 문서 자체가 의료·법률·금융·안전 필수 시스템의 자율적 고위험 판단을 전문가 감독·검증 없이 수행하도록 의도하지 않았다고 밝힙니다. (4쪽)

 

결론: 코딩 및 복합 도구 작업의 후보 모델로 평가할 근거는 있지만, 모델카드만으로 “전반적으로 더 안전하다”거나 “전문 업무를 자율적으로 맡길 수 있다”고 결론 내리기는 어렵습니다. 도입 판단에는 자체 과제 기반의 동일 조건 성능시험과 배포 채널별 안전성 시험이 우선입니다.

 

728x90
반응형
Posted by Mr. Slumber
,