석양의 오그리마를 굽어보는 오크 전쟁군주와 호드 깃발, 붉은 도시

Orc Hwang's Wiki

개발 학습 기록과 기술 지식을 체계적으로 관리하는 개인 위키입니다.

Lok'tar! 학습은 정복, 완료는 도장깨기 — 한 전장씩 함락하는 오그리마의 학습 코덱스

최근 출정 기록

한계와 전망 — test-time compute 부재와 System One 시장 (JEV Essential 7단계)

llm inference evaluation structured-output calibration
JEV Essential 시리즈의 마지막 단계입니다. test-time compute 부재가 규정하는 판단 특화 모델의 능력 상한, 적대적 입력·도메인 이동·주관적 질문이라는 미검증 지대(도입 전 점검 목록 포함), 독립 벤치마크 부재 속 해자 논쟁의 남은 쟁점, 그리고 생성/판정 분리가 상품화되는 System One 시장의 전망까지 — 시리즈를 관통...

판단을 코드에 꽂기 — 확률 + 임계값 설계 패턴 (JEV Essential 6단계)

llm evaluation architecture structured-output
보정된 확률을 소프트웨어 부품으로 쓰는 법을 다룹니다. 파이프라인의 판단 지점을 발견·목록화하는 방법, 세 활용 영역(컨텍스트 찾기·작업 검사·의사결정)의 설계 패턴, 확률 + 임계값 + 폴백 아키텍처, 값싼 판정기를 triage로 배치하는 이유, 그리고 '지식 노동의 린터'라는 새 도구 계층까지 — 실전 Python 의사코드와 함께 정리합니다.

Jev 해부 — System One 아키텍처와 저지연 구조화 출력 (JEV Essential 5단계)

llm inference structured-output latency
TypeSafe Jev의 System One 아키텍처를 해부합니다. 구조화 출력 전용 설계와 70ms~500ms 지연 프로파일, Doom 실시간 시연에서 출발해, prefill + 단일 토큰 constrained decoding으로 속도를 재현한 Sean Goedecke의 반박을 검토하고 — 차별점이 아키텍처 층인가 추론 전략 층인가를 증거 기반으로 ...

확률 보정 (Calibration) — 신뢰할 수 있는 확률의 조건과 RLCD (JEV Essential 4단계)

llm calibration evaluation
모델이 0.9라고 말할 때 실제로 90% 맞아야 그 확률을 if문에 꽂을 수 있습니다. 보정의 정의와 정확도와의 구분, 신경망이 과신하는 이유, reliability diagram·ECE 측정, 온도 스케일링의 원리와 한계, 도메인 이동 시 보정 붕괴가 임계값 자동화에 미치는 영향, 그리고 RLCD가 통상 RLHF와 목적 함수에서 어떻게 달라야 하는지...

판단의 계보 — 분류기, LLM-as-Judge, 판단 특화 모델 (JEV Essential 3단계)

llm evaluation classification lm-as-judge calibration
JEV Essential 3단계. '질문을 받아 확률을 돌려주는 모델'은 사실 오래된 물건입니다 — 전통적 지도학습 분류기가 정확히 그 일을 했습니다. 분류기(속도·보정 vs 태스크당 학습 데이터) → LLM-as-Judge(zero-shot 유연성 vs 파싱·비용·지연·편향) → 판단 특화 모델(유연성 + 확률)로 이어지는 계보를 따라가며, Jev가...

명예의 전당 Featured

손수 고른 전리품 — 오크의 자랑. 선반에 걸어 둔 다섯 정복기.

진행 중인 원정 Latest Series

가장 최근에 진군한 다섯 원정 — 마지막으로 함락한 전장.