한계와 전망 — test-time compute 부재와 System One 시장 (JEV Essential 7단계)

llm inference evaluation structured-output calibration
JEV Essential 시리즈의 마지막 단계입니다. test-time compute 부재가 규정하는 판단 특화 모델의 능력 상한, 적대적 입력·도메인 이동·주관적 질문이라는 미검증 지대(도입 전 점검 목록 포함), 독립 벤치마크 부재 속 해자 논쟁의 남은 쟁점, 그리고 생성/판정 분리가 상품화되는 System One 시장의 전망까지 — 시리즈를 관통...

판단을 코드에 꽂기 — 확률 + 임계값 설계 패턴 (JEV Essential 6단계)

llm evaluation architecture structured-output
보정된 확률을 소프트웨어 부품으로 쓰는 법을 다룹니다. 파이프라인의 판단 지점을 발견·목록화하는 방법, 세 활용 영역(컨텍스트 찾기·작업 검사·의사결정)의 설계 패턴, 확률 + 임계값 + 폴백 아키텍처, 값싼 판정기를 triage로 배치하는 이유, 그리고 '지식 노동의 린터'라는 새 도구 계층까지 — 실전 Python 의사코드와 함께 정리합니다.

확률 보정 (Calibration) — 신뢰할 수 있는 확률의 조건과 RLCD (JEV Essential 4단계)

llm calibration evaluation
모델이 0.9라고 말할 때 실제로 90% 맞아야 그 확률을 if문에 꽂을 수 있습니다. 보정의 정의와 정확도와의 구분, 신경망이 과신하는 이유, reliability diagram·ECE 측정, 온도 스케일링의 원리와 한계, 도메인 이동 시 보정 붕괴가 임계값 자동화에 미치는 영향, 그리고 RLCD가 통상 RLHF와 목적 함수에서 어떻게 달라야 하는지...

판단의 계보 — 분류기, LLM-as-Judge, 판단 특화 모델 (JEV Essential 3단계)

llm evaluation classification lm-as-judge calibration
JEV Essential 3단계. '질문을 받아 확률을 돌려주는 모델'은 사실 오래된 물건입니다 — 전통적 지도학습 분류기가 정확히 그 일을 했습니다. 분류기(속도·보정 vs 태스크당 학습 데이터) → LLM-as-Judge(zero-shot 유연성 vs 파싱·비용·지연·편향) → 판단 특화 모델(유연성 + 확률)로 이어지는 계보를 따라가며, Jev가...

JEV Essential Curriculum — 판단 특화 모델의 배경·본질·활용

llm inference structured-output evaluation calibration curriculum
TypeSafe의 판단 특화 모델 Jev를 이해하기 위한 7단계 학습 로드맵입니다. 구조화 출력과 제약 디코딩, 추론 비용 구조, LLM-as-Judge, 확률 보정이라는 배경에서 출발해 System One 아키텍처의 본질을 해부하고, 확률+임계값 설계 패턴과 한계·전망까지 도장깨기로 정복합니다.

0.7초 만에 내 글 전부를 심사한 모델: TypeSafe Jev 미니 바이브 체크 (Mike Taylor)

articles ai llm agentic-engineering evaluation structured-output
Every의 'Also True for Humans' 칼럼에서 Mike Taylor가 TypeSafe의 판단 특화 모델 Jev를 직접 테스트한 글을 분석한다. 777개의 판단을 0.7초에, 0.25센트로 처리하는 모델이 '지식 노동의 린터'라는 새로운 도구 계층을 여는 과정 — 그리고 그것이 에이전트 검증 문제에 주는 함의를 정리한다.

GPT-6 Astra: 하니스가 곧 제품이다 (Few-Shot Academy, Mangat Rai)

articles ai llm agent-harness agentic-engineering evaluation
Few-Shot Academy의 Mangat Rai가 쓴 'GPT-6 Astra: the harness is the product'를 분석·정리한다. Astra의 진짜 혁신은 모델이 아니라 메모리·도구·컨텍스트·제어를 묶은 런타임 하니스라는 주장과, 같은 모델이 하니스에 따라 54.8% vs 99.9%로 갈리는 45.1포인트 격차, 그리고 '2회 평가...

CS336 12강 — 평가(Evaluation): 하나의 참된 평가는 없다

llm evaluation benchmark lm-as-judge cs336 language-modeling
Stanford CS336 12강 정리. '하나의 참된 평가는 없다' — 무엇을 알고 싶은가에 따라 달라지는 평가. perplexity 같은 내재적 지표, MMLU·GPQA 등 지식 벤치마크, LM-as-judge와 Chatbot Arena, 에이전트·안전 벤치마크, 그리고 현실성·오염(contamination)·타당성이라는 평가의 함정까지.