07.AI/4.AI 비용

LLM - 추론 최적화 - GPT-6 Astra, 루프형 트랜스포머(Looped Transformers)

Mr. Slumber 2026. 9. 17. 01:16
728x90
반응형

https://magazine.sebastianraschka.com/p/gpt-6-astra-looped-transformers-and

2026.9.9
[GPT-6 Astra, Looped Transformers, and Hidden Reasoning]

이 글은 OpenAI의 GPT-6 아스트라 출시와 함께 화제가 된 루프형 트랜스포머(Looped Transformers) 및 숨겨진 추론(Hidden Reasoning) 기술을 심층적으로 분석한 기술 칼럼입니다. 저자인 세바스찬 라슈카 박사는 아스트라 모델이 보여주는 뛰어난 컴퓨터 사용 능력과 벤치마크 성능을 먼저 소개하며, 이 모델이 기존 방식과 달리 동일한 가중치를 가진 블록을 반복 통과시켜 연산 효율을 높이는 재귀적 깊이(Recurrent Depth) 구조를 채택했을 가능성을 설명합니다. 특히 이러한 아키텍처 변화가 모델의 내부 연산량을 늘려 겉으로 드러나는 사고의 연쇄(Chain of Thought) 과정을 단축시킬 수는 있지만, 이것이 의도적으로 추론 과정을 은폐하거나 해석 가능성을 해치는 근본적인 원인은 아니라고 주장합니다. 결과적으로 이 텍스트는 최신 AI 연구 문헌들을 통해 루프형 구조가 제한된 컴퓨팅 예산 내에서 모델 성능을 최적화하는 효율적인 전략임을 입증하며 독자들에게 차세대 대규모 언어 모델의 설계 원리를 명확하게 전달합니다.

 

그림 3: 컴퓨터 사용 교육 워크플로 개요.

 

그림 5. Nanbeige4.2-3B는 동일한 22개 변환기 블록 스택을 두 번 적용합니다. 주황색 ​​화살표는 중간 표현이 스택으로 다시 전달되는 위치를 나타냅니다.
그림 6. Nanbeige4.2-3B는 동일한 22개의 변압기 블록을 두 번 통과하여 펼쳐지며, 총 44개의 블록에 적용됩니다.

 

 

그림 7: 기존 방식과 반복 방식을 사용할 때 필요한 매개변수 개수를 나란히 비교하여 보여줍니다.

 

키-값 캐시는 실제 운영 환경에서 LLM 추론을 효율적으로 수행하는 데 있어 가장 중요한 기술 중 하나입니다. KV 캐시는 효율적인 LLM 추론을 위한 핵심 요소이며, 이 글에서는 개념적인 설명과 함께 사람이 읽기 쉬운 코드 구현 예시를 통해 그 작동 방식을 설명합니다.
그림 8: 범용 변압기의 적응형 정지.
그림 9. 재귀 혼합 알고리즘은 공유 스택을 토큰 위치에 따라 서로 다른 횟수만큼 적용합니다. 강조 표시된 텍스트는 1회, 2회 또는 3회 적용 예시를 보여줍니다. 이 그림은  재귀 혼합 알고리즘 논문 에서 발췌했습니다  .

 

그림 10. 재귀 깊이를 선택하는 두 가지 방법. 왼쪽에서는 라우터가 각 단계에서 어떤 토큰을 계속 진행할지 선택합니다. 오른쪽에서는 단일 라우터가 시작 시 통과 횟수를 지정합니다. 이 그림은  Mixture-of-Recursions 논문 에서 발췌했습니다  .

 

728x90
반응형