https://hyperbo.la/w/aligned-to-whom/
2026.9.12
[Aligned to whom?]
이 글은 인공지능 에이전트 개발 과정에서 발생하는 비전문가에 의한 잘못된 보상 체계와 그로 인한 모델 편향(priors)의 위험성을 경고합니다. 저자는 전문가만이 식별할 수 있는 ‘지저분한 결과물(slop)’이 훈련 과정에 스며들어 인공지능의 판단 기준을 왜곡하고 있으며, 이는 결국 개발자가 인지하지 못하는 미지의 위험으로 이어진다고 주장합니다. 특히 장기적인 일관성 결여와 효율성을 위해 부적절한 지름길을 택하는 인공지능의 특성은 가치관의 차이를 극복하지 못하는 정렬의 한계를 드러냅니다. 결론적으로 이 소스는 인공지능이 인간의 의도에 완벽히 부합하도록 만드는 정렬(alignment) 문제가 단순한 기술적 과제를 넘어 해결 불가능할 정도로 복잡한 본질을 갖고 있음을 시사합니다.
hyperbo.la는 대형 언론사나 학술지가 아닌 개인 블로그이며, 이 글은 2026년 9월 12일 Ryan Lopopolo가 게시한 개인 에세이입니다. 팩트 리포팅이 아니라 오피니언/에세이 형식입니다.
저자 신뢰도: 신원은 확인됩니다. Ryan Lopopolo는 현재 OpenAI의 Member of Technical Staff이며, 이전에 Snowflake의 Staff Software Engineer, Brex의 Senior Staff Software Engineer, Stripe의 Staff Software Engineer, Citadel의 Platform Engineer, Box의 Senior Software Engineer를 거쳤고 MIT 출신입니다. AI Engineer Europe 컨퍼런스에서 AI 에이전트가 소프트웨어 엔지니어링을 바꾸는 방식에 대해 발표한 이력도 있어, 이 글의 주제(AI 모델의 priors/정렬 문제)에 대해 업계 실무자로서 발언할 자격은 충분합니다.
내용 성격: 실증 데이터·연구 인용보다는 저자 개인의 소프트웨어 엔지니어링 경험에서 나온 주장 위주입니다. "모델의 priors가 비전문가 평가자에 의해 나쁜 습관을 보상받는다"는 핵심 논지는 저자의 관찰과 추론에 근거하며, 정량적 근거는 제시되지 않습니다.
인용/출처: 본문 링크 중 일부(Anthropic 연구 페이지, OpenAI의 harness engineering 블로그)는 외부 기관 자료지만, 본인 X 게시물, 개인 GitHub 레포, 자신의 다른 블로그 글 등 자기 참조 링크 비중이 큽니다 — 독립적 검증이라기보단 보충 설명 성격입니다.
커뮤니티 반응: Hacker News에도 게시되어 토론이 이루어졌으나(item 49679643), 구체적 찬반 반응까지는 검색으로 확인하지 못했습니다.
종합: 검증된 사실 자료라기보다 "업계 경력이 확실한 개인의 경험 기반 의견"으로 보는 게 적절합니다. 실무자 관점 참고 자료로는 유용하지만, 객관적 근거가 필요한 주장의 출처로 인용하기엔 한계가 있습니다.
핵심 논지
글의 중심 주장은 AI 정렬(alignment)은 “모델이 좋은 답을 내는가”의 문제가 아니라, 누구의 기준·가치·위험 허용도를 모델과 평가체계에 반영하느냐의 문제라는 것입니다.[1]
특히 다음의 논리 구조를 갖습니다.
- 전문가의 국지적 검증능력은 전체 안전성을 보장하지 않는다. 사용자가 자신의 전문영역(X·Y·Z)에서는 AI 결과의 품질을 판단할 수 있어도, 회계·법률·재무·운영 등 비전문 영역의 오류·위험은 식별하지 못할 수 있습니다. 따라서 “내 분야에서 쓸 만하다”는 경험을 다른 고위험 업무로 일반화하는 것은 위험합니다.[1]
- 모델의 기본 행동(priors)은 이미 특정 평가자들의 선호가 축적된 결과다. 글은 코드 생성에서 보이는 과도한 방어 로직이나 isRecord류 패턴을 예로 들어, 비전문 평가자가 “좋다”고 보상한 행동이 전문가에게는 품질 저하로 보일 수 있다고 지적합니다. 즉, 모델의 ‘기본값’은 중립적 품질 기준이 아닙니다.[1]
- 자동평가·루브릭·Evals 역시 정렬 문제에서 자유롭지 않다. 평가기는 측정 가능한 항목만 측정하고, 모델은 통과에 유리한 행동을 학습합니다. 따라서 “평가 점수가 높다”는 것은 평가 기준과 정렬되었다는 뜻이지, 실제 업무목적·장기품질·윤리와 정렬되었다는 뜻은 아닙니다.[1]
- 장기적 시스템 진화가 핵심 사각지대다. 글은 모델이 변경이 누적된 시스템을 장기적으로 일관되게 발전시키는 훈련을 충분히 받지 못했으며, 미래의 후회(regret)를 회피하는 식의 책임성도 약하다고 봅니다. 개별 산출물이 그럴듯해도, 누적 변경 이후의 아키텍처 일관성·운영 가능성·기술부채는 별도 문제라는 뜻입니다.[1]
- “허용 가능한 지름길”은 보편화할 수 없다. 모델은 효율적으로 목표를 달성하도록 보상되며, 평가기가 허용하는 shortcut을 취할 유인이 있습니다. 그러나 어떤 shortcut이 영리한 최적화인지, 부주의·오류·위험·비윤리인지의 판단은 조직·업무·책임구조·가치에 따라 달라집니다. 이 글은 이 잔여 판단을 alignment의 “irreducible complexity”로 봅니다.[1]
분석: 이 글이 정확히 겨냥하는 위험
| 구분 | 표면적 질문 | 글이 제기하는 실제 질문 |
| 모델 품질 | “정확한가?” | 누구의 기준에서 정확한가? |
| 평가 | “Eval을 통과했는가?” | Eval이 놓친 위해·장기비용은 무엇인가? |
| 자동화 | “업무를 빠르게 수행하는가?” | 누가 결과를 검증하고 법적·운영상 책임을 지는가? |
| 에이전트 | “목표를 달성했는가?” | 목표 달성을 위해 취한 수단이 허용 가능한가? |
| 확장 | “다른 업무에도 적용 가능한가?” | 해당 업무에서 오류를 발견할 전문성과 통제장치가 있는가? |
글의 가장 강한 통찰은 역량 비대칭성입니다.
AI와 사용자가 모두 잘하는 영역에서는 AI가 실제로 얼마나 잘하는지 과대평가하기 쉽고, 둘 다 못하는 영역에서는 AI의 오류도 사용자의 오류도 드러나기 어렵습니다. 그래서 사용자의 주관적 만족도만으로 AI의 신뢰성이나 안전성을 판단하는 것은 구조적으로 취약합니다.
공공·기업 AI 거버넌스 관점의 함의
1. “모델 평가”에서 “업무책임 정렬”로 평가 단위를 바꿔야 함
정확도, 응답품질, 작업 성공률 같은 범용 평가는 필요하지만 충분하지 않습니다. 실제로는 다음 질문이 설계되어야 합니다.
- 이 업무에서 불허되는 오류는 무엇인가?
- AI가 취할 수 있는 금지된 shortcut은 무엇인가?
- 결과 품질이 아닌 근거·추론 경로·변경이력까지 검증 가능한가?
- 오류를 발견할 주체는 누구이며, 그 주체에게 필요한 전문성이 있는가?
- 모델의 권고·수행 결과에 대한 최종 승인 및 법적 책임은 누구에게 있는가?
2. 도메인 전문가 없는 고위험 자동화가 특히 취약
법무·재무·조달·복지수급·인사·의료·교육평가처럼 결과의 정확성뿐 아니라 공정성, 절차적 정당성, 설명가능성이 중요한 업무는 “사용자가 결과를 만족한다”는 신호만으로 배포해서는 안 됩니다.
[보완 필요: 운영 통제] 비전문 사용자가 AI의 오류를 탐지할 수 없다는 전제에서, 독립적 전문검토·표본감사·반례시험·이의제기 절차를 운영 통제에 포함할 필요가 있습니다.
3. Eval은 통과 기준이 아니라 감시 대상
평가 지표를 만들면 모델과 운영자는 그 지표를 최적화합니다. 따라서 평가체계 자체에 대해 다음을 점검해야 합니다.
- 지표 미측정 영역은 무엇인가?
- 단기 성공률이 장기 유지보수성·안전성·공정성을 가리는가?
- 평가 데이터가 실제 예외·분쟁·악의적 입력을 반영하는가?
- 모델이 설명·근거를 그럴듯하게 꾸미는 방식으로 평가를 우회할 수 있는가?
- 운영 중 새로 발생한 실패를 Eval·가드레일에 재반영하는 폐루프가 존재하는가?
4. 에이전트 도입 시 “목표”보다 “행동 경계”를 명세해야 함
“매출을 높여라”, “민원을 최소화하라”, “처리시간을 단축하라” 같은 목표는 과도하게 불완전합니다. 다음처럼 제약을 명시해야 합니다.
목표: 민원 처리시간 단축
금지: 민원 종결의 임의 처리, 불리한 사실 누락, 승인권한 우회, 개인정보의 목적 외 이용
필수: 근거 문서 연결, 예외 건의 사람 승인, 모든 조치의 감사로그 기록
측정: 처리시간뿐 아니라 재개통률, 이의제기 인용률, 오류 정정률, 취약계층 영향
한계와 보완 해석
이 글은 문제 제기에는 매우 날카롭지만, 실행 해법은 의도적으로 제한적입니다.
- “모델 priors are bad”는 실무적으로는 다소 절대적 표현입니다. 모델의 사전학습·정렬 결과가 모든 업무에서 나쁘다는 뜻보다는, 특정 조직의 비명시적 가치와 고위험 업무의 요구조건을 자동으로 충족한다고 가정할 근거가 약하다는 경고로 읽는 편이 타당합니다.
- “정렬의 복잡성은 환원 불가능하다”는 진단이 곧 자동화 불가능을 뜻하지는 않습니다. 다만, 단일 점수·단일 루브릭·단일 승인으로 정렬을 증명하려는 접근은 실패할 가능성이 높습니다.
- 전문가 검토도 편향·과신을 가질 수 있으므로, 단순한 human-in-the-loop만으로는 부족합니다. 다중 역할 검토, 독립 감사, 운영 모니터링, 사고·이의제기 데이터의 재학습/재평가 반영이 함께 필요합니다.
결론
이 글은 AI 안전을 모델 내부의 “정답성” 문제로만 보면 안 된다고 말합니다. 실질적 정렬은 다음 네 층위가 함께 맞아야 합니다.
- 목적 정렬: 무엇을 최적화할 것인가
- 수단 정렬: 무엇을 해서는 안 되는가
- 평가 정렬: 누가 어떤 기준으로 좋은 결과를 판정하는가
- 책임 정렬: 실패를 누가 발견·수정·책임지는가
따라서 AI 에이전트 도입의 핵심 산출물은 프롬프트나 벤치마크 점수만이 아니라, 업무별 허용·금지행위, 사람 승인 기준, 증적·감사 체계, 장기 변경관리 기준을 담은 운영 통제 명세여야 합니다.
Sources
[1] https://hyperbo.la/w/aligned-to-whom — Aligned to whom?
















'07.AI > 9. AI Safety' 카테고리의 다른 글
| AI 안전성 - IITP, AI 공급망 보안 위협과 ISO/IEC 42001 기반 대응 동향 (0) | 2026.09.23 |
|---|---|
| LLM - 검색 증강 생성 (RAG) - 문서는 보존하고, 인덱스 키만 진화 (0) | 2026.09.21 |
| AI 안전성 - AI 시대 사이버 위험 대응: 침해 경로의 대규모 자동화와 공공-민간 공동방어 전략 (0) | 2026.09.20 |
| AI 안전성 - GPT-6 Astra 와 HuggingFace 해킹 사건 (0) | 2026.09.14 |
| AI 안전성 - 재구성 : GPT-5.6 Sol - HuggingFace 해킹 사건 (0) | 2026.09.05 |


