JEV Essential 시리즈의 마지막 단계입니다. test-time compute 부재가 규정하는 판단 특화 모델의 능력 상한, 적대적 입력·도메인 이동·주관적 질문이라는 미검증 지대(도입 전 점검 목록 포함), 독립 벤치마크 부재 속 해자 논쟁의 남은 쟁점, 그리고 생성/판정 분리가 상품화되는 System One 시장의 전망까지 — 시리즈를 관통...
보정된 확률을 소프트웨어 부품으로 쓰는 법을 다룹니다. 파이프라인의 판단 지점을 발견·목록화하는 방법, 세 활용 영역(컨텍스트 찾기·작업 검사·의사결정)의 설계 패턴, 확률 + 임계값 + 폴백 아키텍처, 값싼 판정기를 triage로 배치하는 이유, 그리고 '지식 노동의 린터'라는 새 도구 계층까지 — 실전 Python 의사코드와 함께 정리합니다.
모델이 0.9라고 말할 때 실제로 90% 맞아야 그 확률을 if문에 꽂을 수 있습니다. 보정의 정의와 정확도와의 구분, 신경망이 과신하는 이유, reliability diagram·ECE 측정, 온도 스케일링의 원리와 한계, 도메인 이동 시 보정 붕괴가 임계값 자동화에 미치는 영향, 그리고 RLCD가 통상 RLHF와 목적 함수에서 어떻게 달라야 하는지...
JEV Essential 3단계. '질문을 받아 확률을 돌려주는 모델'은 사실 오래된 물건입니다 — 전통적 지도학습 분류기가 정확히 그 일을 했습니다. 분류기(속도·보정 vs 태스크당 학습 데이터) → LLM-as-Judge(zero-shot 유연성 vs 파싱·비용·지연·편향) → 판단 특화 모델(유연성 + 확률)로 이어지는 계보를 따라가며, Jev가...
TypeSafe의 판단 특화 모델 Jev를 이해하기 위한 7단계 학습 로드맵입니다. 구조화 출력과 제약 디코딩, 추론 비용 구조, LLM-as-Judge, 확률 보정이라는 배경에서 출발해 System One 아키텍처의 본질을 해부하고, 확률+임계값 설계 패턴과 한계·전망까지 도장깨기로 정복합니다.
Every의 'Also True for Humans' 칼럼에서 Mike Taylor가 TypeSafe의 판단 특화 모델 Jev를 직접 테스트한 글을 분석한다. 777개의 판단을 0.7초에, 0.25센트로 처리하는 모델이 '지식 노동의 린터'라는 새로운 도구 계층을 여는 과정 — 그리고 그것이 에이전트 검증 문제에 주는 함의를 정리한다.
Few-Shot Academy의 Mangat Rai가 쓴 'GPT-6 Astra: the harness is the product'를 분석·정리한다. Astra의 진짜 혁신은 모델이 아니라 메모리·도구·컨텍스트·제어를 묶은 런타임 하니스라는 주장과, 같은 모델이 하니스에 따라 54.8% vs 99.9%로 갈리는 45.1포인트 격차, 그리고 '2회 평가...
Stanford CS336 12강 정리. '하나의 참된 평가는 없다' — 무엇을 알고 싶은가에 따라 달라지는 평가. perplexity 같은 내재적 지표, MMLU·GPQA 등 지식 벤치마크, LM-as-judge와 Chatbot Arena, 에이전트·안전 벤치마크, 그리고 현실성·오염(contamination)·타당성이라는 평가의 함정까지.