반응형

https://typesafe.ai/blog/introducing-system-one-models-and-jev

2026.9.15
[Introducing System One Models & Jev]

TypeSafe AI가 발표한 이 블로그 글은 기존 언어 모델의 한계를 넘어 소프트웨어 자동화에 최적화된 새로운 모델 클래스인 '시스템 원(System One)'과 그 첫 번째 모델인 '제브(Jev)'를 소개합니다. 제브는 텍스트를 생성하는 대신 미리 정의된 구조화된 데이터를 출력하도록 설계되어 인공지능의 고질적인 문제인 환각 현상을 원천적으로 차단하며, 기존 모델 대비 수백 배 빠른 속도와 저렴한 비용을 자랑합니다. 이 기술은 인간과의 대화보다는 복잡한 워크로드의 의사결정이나 실시간 데이터 처리에 특화되어 있으며, 개발자가 신뢰할 수 있는 유형 안전성(Type-safe)과 정밀한 신뢰도 점수를 제공하는 것이 핵심입니다. 결과적으로 저자는 지능의 비용을 획기적으로 낮춤으로써 실제 산업 현장의 완전한 자동화를 가속화하겠다는 포부를 밝히고 있습니다.

 

  1. “빠른 JSON LLM”이 아니라 decision API라는 주장 정확합니다. Jev는 텍스트를 생성하지 않고, 사전 정의된 Choice / Score / Noul에 대해 타입값과 확률분포를 돌려줍니다.
  1. Shared state + 다중 질문 병렬처리 가설 제품 동작과 잘 부합합니다. 공식 문서도 동일 state에 여러 질문을 넣고, 질문별로 독립·병렬 평가하며 질문 수 증가가 지연시간에 거의 영향을 주지 않는다고 설명합니다.[2] 다만 이것이 정확히 KV cache 공유인지, shared encoder인지, tree attention인지까지는 공개 정보로 확정할 수 없습니다.
  1. Question isolation의 중요성 아주 중요한 관찰입니다. 질문 A가 질문 B의 문구나 결론을 오염시키지 않는다면, 원자적 판단을 코드에서 조합하는 정책엔진 구조에 적합합니다. 이는 일반 LLM 프롬프트 하나에 복수 판단을 넣을 때 생기는 상호 간섭과 대비됩니다.
  1. 확률분포와 confidence의 구분 정확한 지적입니다. TypeSafe의 confidence는 분포의 집중도를 압축한 통계량이며, Choice·Score 응답의 확률분포에서 산출됩니다. 즉 confidence=0.9가 개별 판단의 실제 정답률 90%라는 뜻은 아닙니다.

추정으로 분리해야 할 부분

주장 판단 근거 수준
직접 probability readout 공식 API 동작과 부합 높음
Autoregressive text generation 미사용 공식 설명과 부합 높음
Shared state / 질문 병렬성 공식 문서 및 API 동작과 부합 높음
Question isolation 블랙박스 실험 및 문서 주장 중간~높음
Listwise option decision 옵션 추가 시 분포 변화 관찰에 기반 중간
KV cache 공유 합리적 serving 가설이나 비공개 중간
Causal decoder / pointer head 공개 증거 부족 낮음
Sparse MoE 속도·업계 추세에서 유추한 가설 낮음

특히 “Sparse MoE Transformer”는 현 단계에서 사실로 쓰면 안 됩니다. 회사가 아키텍처와 RLCD 학습 세부를 공개하지 않았고, API 관찰만으로 MoE를 식별할 방법은 제한적입니다.

핵심 보완점

이 글의 “Jev는 LLM이 아니다”라는 문구는 제품·인터페이스 관점에서는 유효하지만, 연구적으로는 다소 강합니다.

더 정확한 표현은 다음입니다.

Jev는 LLM 계열의 언어 이해 역량을 활용할 수 있으나, 자기회귀 텍스트 생성 대신 제한된 선택공간의 확률적 의사결정에 최적화된 System One 모델이다.

즉, 생성 모델과 분류기 사이의 이분법보다는 다음 스펙트럼에 가깝습니다.

textCopy

전통 분류기

└ 고정 레이블·고정 입력 특성

 

System One / Jev

└ 자연어 state + 자연어 질문/선택지

└ 구조화된 확률분포 출력

└ 코드 기반 정책 조합

 

일반 LLM

└ 자연어 state + 자유 생성

└ 설명·코드·추론·대화

연구적으로 더 중요한 질문

이 글의 구조 가설보다 우선 검증해야 할 것은 다음 세 가지입니다.

  1. 확률 보정성: p=0.8인 표본군에서 실제 정답률이 정말 약 80%인가? ECE, classwise ECE, Brier score, NLL, reliability diagram으로 업무·선택지·기관별 검증이 필요합니다.
  1. 분포 이동 안전성: 법령·정책 변경, 새 문서 양식, OCR 오류, 한국어 혼합문서, adversarial prompt에서 보정성과 정확도가 얼마나 붕괴하는가? In-domain 보정만으로는 충분하지 않습니다.
  1. 워크플로우 수준 안전성: 원자 질문 각각이 잘 보정되어도 여러 확률을 규칙으로 조합한 최종 action이 보정된다는 보장은 없습니다. 따라서 질문 단위뿐 아니라 최종 정책결정 단위의 risk-coverage 및 기대손실을 측정해야 합니다.

종합 판단

이 글은 Jev를 “말을 생성하지 않는 확률 기반 decision engine”으로 이해하는 데 매우 유용합니다. 특히 Shared state, question isolation, listwise option interaction은 실제 PoC에서 검증할 가치가 큰 가설입니다.

다만 아키텍처를 단정하기보다 아래처럼 증거 수준을 분리하는 것이 연구·감리 문서에는 적절합니다.

  • 확인: 타입 안전 출력, 텍스트 비생성, 병렬형 다중 판단 API
  • 유력 가설: shared state 처리, 질문 격리, 옵션 간 공동 판단
  • 확인 필요: KV cache 설계, decoder/head 구조, Sparse MoE, RLCD 목적함수·학습데이터

 

728x90
반응형
Posted by Mr. Slumber
,