JEV Essential 시리즈의 마지막 단계입니다. test-time compute 부재가 규정하는 판단 특화 모델의 능력 상한, 적대적 입력·도메인 이동·주관적 질문이라는 미검증 지대(도입 전 점검 목록 포함), 독립 벤치마크 부재 속 해자 논쟁의 남은 쟁점, 그리고 생성/판정 분리가 상품화되는 System One 시장의 전망까지 — 시리즈를 관통...
보정된 확률을 소프트웨어 부품으로 쓰는 법을 다룹니다. 파이프라인의 판단 지점을 발견·목록화하는 방법, 세 활용 영역(컨텍스트 찾기·작업 검사·의사결정)의 설계 패턴, 확률 + 임계값 + 폴백 아키텍처, 값싼 판정기를 triage로 배치하는 이유, 그리고 '지식 노동의 린터'라는 새 도구 계층까지 — 실전 Python 의사코드와 함께 정리합니다.
TypeSafe Jev의 System One 아키텍처를 해부합니다. 구조화 출력 전용 설계와 70ms~500ms 지연 프로파일, Doom 실시간 시연에서 출발해, prefill + 단일 토큰 constrained decoding으로 속도를 재현한 Sean Goedecke의 반박을 검토하고 — 차별점이 아키텍처 층인가 추론 전략 층인가를 증거 기반으로 ...
모델이 0.9라고 말할 때 실제로 90% 맞아야 그 확률을 if문에 꽂을 수 있습니다. 보정의 정의와 정확도와의 구분, 신경망이 과신하는 이유, reliability diagram·ECE 측정, 온도 스케일링의 원리와 한계, 도메인 이동 시 보정 붕괴가 임계값 자동화에 미치는 영향, 그리고 RLCD가 통상 RLHF와 목적 함수에서 어떻게 달라야 하는지...
JEV Essential 3단계. '질문을 받아 확률을 돌려주는 모델'은 사실 오래된 물건입니다 — 전통적 지도학습 분류기가 정확히 그 일을 했습니다. 분류기(속도·보정 vs 태스크당 학습 데이터) → LLM-as-Judge(zero-shot 유연성 vs 파싱·비용·지연·편향) → 판단 특화 모델(유연성 + 확률)로 이어지는 계보를 따라가며, Jev가...
prefill은 왜 병렬적이고 싸며, generation은 왜 토큰당 순차 비용을 내는가. KV 캐시와 메모리 대역폭이 만드는 비용 비대칭을 해부하고, 'prefill + 선택지 제약 1토큰' 전략이 왜 2~3배 가속을 만드는지, 단일 토큰 출력에서 표준 배칭이 지연 상한을 낮추는 이유를 계산으로 설명합니다.
JEV Essential 1단계 — LLM이 JSON 같은 형식을 100% 보장하는 원리를 해부합니다. 프롬프트 구슬리기에서 JSON mode·function calling을 거쳐 grammar-constrained decoding(문법 상태 기계 + logit 마스킹)에 이르는 계보를 따라가고, '형식 보장 ≠ 내용 정확성'이라는 핵심 구분과 유한 ...
TypeSafe의 판단 특화 모델 Jev를 이해하기 위한 7단계 학습 로드맵입니다. 구조화 출력과 제약 디코딩, 추론 비용 구조, LLM-as-Judge, 확률 보정이라는 배경에서 출발해 System One 아키텍처의 본질을 해부하고, 확률+임계값 설계 패턴과 한계·전망까지 도장깨기로 정복합니다.
RL을 언어 모델에 실제로 돌리는 법 — 정책 경사의 유도, 분산을 줄이는 baseline과 advantage, 그리고 GRPO를 한 줄씩 구현하며 'raw reward로는 왜 안 되는가'를 눈으로 본다. CS336 시리즈의 마지막 강.
학습된 보상 대신 정답을 검증하는 보상(RLVR) — 수학·코드에서 규칙 기반 보상으로 reward hacking을 줄이고, 이 단순한 전환이 긴 사고사슬을 스스로 학습하는 추론 모델(o1·DeepSeek R1)과 GRPO를 낳았다.
사전학습된 원석을 어시스턴트로 — SFT는 사전학습 행동을 추출할 뿐 새로 더하지 않고(모르는 사실을 학습하면 환각), 선호 데이터로 보상 모델(Bradley-Terry)을 세워 RLHF(PPO·KL 제약)로 사람 선호에 맞추고, 그 보상 모델마저 없애 버리는 DPO까지.
Stanford CS336 14강 정리. raw 웹을 좋은 학습 코퍼스로 바꾸는 세 기술 — 품질 필터링(KenLM·fastText·DSIR), 중복 제거(MinHash·LSH·Bloom filter), 데이터 믹스. 핵심 과제는 목표와 닮은 부분집합을 극도로 빠르게 골라내기.
데이터가 아키텍처보다 모델을 결정한다 — Common Crawl을 학습 코퍼스로 바꾸는 파이프라인(WARC/WET·HTML→텍스트), 사전학습 데이터셋의 계보(C4·The Pile·RefinedWeb·FineWeb·Dolma·DCLM), 그리고 저작권·공정 이용.
Stanford CS336 12강 정리. '하나의 참된 평가는 없다' — 무엇을 알고 싶은가에 따라 달라지는 평가. perplexity 같은 내재적 지표, MMLU·GPQA 등 지식 벤치마크, LM-as-judge와 Chatbot Arena, 에이전트·안전 벤치마크, 그리고 현실성·오염(contamination)·타당성이라는 평가의 함정까지.
Stanford CS336 11강 정리. 실전 LLM 빌더가 스케일링 법칙을 쓰는 법 — Cerebras·MiniCPM·DeepSeek 사례, WSD 학습률로 Chinchilla를 한 번에, '20토큰/파라미터는 출발점일 뿐', 그리고 하이퍼파라미터를 스케일에 불변으로 만드는 muP의 유도와 한계.
Stanford CS336 10강 정리. 추론은 왜 메모리 한계인가 — prefill vs generation, KV 캐시의 정체, 그것을 줄이는 아키텍처(GQA·MLA·local attention)와 트랜스포머 너머(SSM·diffusion), 그리고 양자화·speculative decoding·PagedAttention까지.
Stanford CS336 9강 정리. 손실이 데이터·모델·연산의 거듭제곱으로 줄어드는 스케일링 법칙 — 왜 멱법칙이 자연스러운가, 작은 모델로 아키텍처·하이퍼파라미터를 정하는 법, 그리고 컴퓨트 최적 배분을 알려주는 Chinchilla(파라미터당 20토큰)와 추론을 생각한 over-training.
Stanford CS336 8강 정리. 모델을 쪼개 활성화만 주고받기 — 너비로 자르는 텐서 병렬, 깊이로 자르는 파이프라인 병렬(과 버블), 활성화·시퀀스 병렬, 그리고 셋을 합치는 3D 병렬화의 실전 규칙과 사례(Megatron·DeepSeek·Llama 3).
Stanford CS336 7강(전반) 정리. 한 GPU를 넘어 데이터센터로 — 네트워킹 계층과 집합 통신(all-reduce = reduce-scatter + all-gather), 데이터 병렬의 파라미터당 16바이트 메모리 문제, 그리고 그 중복을 단계적으로 걷어내는 ZeRO 1·2·3(=FSDP).
Stanford CS336 6강 정리. GPU 코드를 빠르게 만드는 실전 — 벤치마킹(warm-up·cuda.synchronize)과 프로파일링(CPU/GPU 비동기 모델)으로 병목을 찾고, GELU 커널을 수동 PyTorch·내장·CUDA C++·Triton·torch.compile 다섯 가지로 써 보며 커널 퓨전의 효과를 잰다.
Stanford CS336 5강 정리. GPU를 마법이 아니라 구조로 이해하기 — SM·메모리 계층·SIMT 실행 모델, 루프라인과 산술 강도, 그리고 정밀도·퓨전·재계산·코얼레싱·타일링이라는 6가지 도구로 메모리 병목을 줄여 Flash Attention에 이르는 길.
Stanford CS336 4강 정리. Dense FFN을 라우터 + 여러 전문가로 바꿔 FLOPs는 그대로 두고 파라미터만 키우는 MoE — token-choice top-k 라우팅, fine-grained·shared 전문가, 부하 분산 손실과 DeepSeek V3의 보조손실 없는 균형, 그리고 MLA·MTP까지.
Stanford CS336 3강 정리. 2017~2025년 약 19개 모델의 '수렴 진화'에서 배운 현대 트랜스포머의 합의 — Pre-norm·RMSNorm·bias 제거·SwiGLU·RoPE, 그리고 d_ff 비율·aspect ratio 같은 하이퍼파라미터 규칙과 z-loss·QK-norm·MQA/GQA까지.
Stanford CS336 2강 정리. 모델을 '느낌'이 아니라 숫자로 다루는 자원 회계 — 메모리(부동소수점 타입·AdamW의 16바이트/파라미터)와 연산(행렬곱 2mnp → 학습 6ND), 그리고 MFU까지 냅킨 한 장으로 계산합니다.
Stanford CS336 1강 정리. 코스를 관통하는 한 단어 '효율'에서 출발해, 텍스트를 토큰으로 바꾸는 토크나이제이션을 문자·바이트·단어 방식의 한계부터 BPE(Byte Pair Encoding) 밑바닥 구현까지 따라갑니다.
Stanford CS336 'Language Modeling from Scratch'(2025 봄) 17개 강의를 토크나이저·아키텍처·시스템·스케일링·데이터·정렬의 5개 유닛, 17단계로 재구성한 종합 학습 로드맵입니다. 도장깨기 방식으로 LLM을 밑바닥부터 직접 만드는 여정을 추적합니다.