Sandeco Macedo의 arXiv 논문(2607.27578)을 분석·정리한다. LangGraph·DSPy가 이미 노출하는 '프롬프트 그래프'를 4개 조건(G1–G4)과 4개 판정 테스트(T1–T4)로 정의하고, Claude Code 서브에이전트를 의도적 반례로 배제하는 정의적 논문이다.
Martin Fowler의 Exploring Gen AI 시리즈에 실린 Giles Edwards-Alexander의 실험 글을 분석한다. 17,155줄짜리 Rust 파일을 15단계로 리팩터링하자, 동일한 기능 추가에 드는 입력 토큰이 83% 줄었다 — 에이전트 코드베이스에서 '코드 품질'이 어떻게 곧 '비용'이 되는지에 대한 정량적 증거다.
Sanderson Oliveira de Macedo의 arXiv 논문(2606.10106)을 분석·정리한다. LLM을 에이전트로 바꾸는 '하니스'라는 널리 쓰이지만 정의 없던 용어를 4개 필요충분조건(T1–T4)으로 규정하고, Claude Code·SWE-agent 등 실제 6개 시스템에 적용하는 정의적 논문이다. 자매편 prompt graph eng...
rody(@0x_rody)가 X에 올린 'How to Do Graph Engineering With Opus 5' 스레드를 정리·분석한다. temporal knowledge graph의 유일한 킬러 비용인 '추출 호출'을, Opus 5의 프롬프트 캐싱($0.50/M)·effort 분리(추출 low / traversal high)·배치 API(50% 할...
Reddit·Hacker News에서 뜨는 'graph engineering'을 조사해 loop engineering의 다음 단계로 정의한다 — 에이전트를 무한 루프가 아니라 타입된 상태·조건부 엣지·체크포인트를 가진 명시적 그래프로 설계하는 흐름. 이 위키의 loop engineering·durable execution·데이터 엔지니어링 DAG 글과...
Inkdrop 개발자 Takuya Matsuyama(craftzdog)가 만든 tmux 플러그인 tmux-claude-session-manager를 GitHub 저장소와 제작자의 데모 영상(14분)을 함께 놓고 분석한다. 여러 프로젝트에 걸쳐 도는 Claude Code 세션들을 fzf 피커 하나로 나열하고, working/waiting/idle 상태를...
Anthropic의 Thariq Shihipar가 쓴 'A field guide to Claude Fable 5: Finding your unknowns'를 정리·분석한다. 코딩 에이전트의 작업 품질을 가로막는 병목은 이제 모델이 아니라 '내가 무엇을 모르는지 명확히 하는 능력'이라는 주장과, 구현 전·중·후에 걸쳐 그 unknowns를 값싸게 발굴하...
Addy Osmani가 Elevate(Substack)에 쓴 'Death of the IDE?'(2026-03-20)를 정리·분석한다. IDE는 죽는 게 아니라 '중심에서 밀려난다'는 주장 — 개발의 주 무대가 한 줄씩 코드를 편집하는 편집기에서, 병렬 에이전트를 계획·위임·검토·통제하는 '컨트롤 플레인(오케스트레이션 레이어)'으로 옮겨 가고 있다는 ...
okTurtles의 Greg Slepak이 쓴 'The Short Leash AI Coding Method For Beating Fable'(2026-07-02)를 정리·분석한다. '오케스트레이터 뒤에 12개 에이전트를 굴리고 개발자는 해변에 눕는' 바이브 접근을 정면으로 거부하고, 프론티어 모델조차 못 내는 품질을 전문가가 AI를 '짧은 목줄'에 매...
OpenAI 엔지니어링 블로그의 'Unrolling the Codex agent loop'(Michael Bolin)를 분석한다. Codex CLi 하니스가 사용자·모델·도구의 상호작용을 어떻게 오케스트레이션하는지를 prompt 조립, role 우선순위, stateless 설계, agent loop의 quadratic 비용, prompt caching...
Modular의 Tim Davis가 쓴 'Probabilistic Engineering and the 24-7 Employee'를 분석한다. 소프트웨어가 정확성을 '아는' 결정론적 엔지니어링에서 정확성을 '믿는' 확률적 엔지니어링으로 옮겨 가고, 사람이 밤새 일하는 에이전트 함대를 지휘하는 24-7 노동 모델이 등장한다는 주장 — 생성은 싸졌지만 검증...
Simon Willison의 'Vibe coding and agentic engineering are getting closer than I'd like'를 분석한다. '코드를 안 보고 만드는 바이브 코딩'과 '전문성을 쥔 채 AI를 쓰는 에이전틱 엔지니어링'을 칼같이 구분해 온 저자가, 에이전트가 믿을 만해질수록 자기도 모든 줄을 리뷰하지 않게 되면...
GitHub 저장소 DietrichGebert/ponytail을 직접 클론해 코드까지 읽고 분석한다. '안 쓴 코드가 최고의 코드'라는 게으른 시니어 개발자의 판단을, 7단계 사다리(ladder) 규칙 한 장과 얇은 어댑터 14개로 코딩 에이전트 안에 심는 스킬 배포 프로젝트다. 무엇을 하는지, 어떻게 동작하는지, 벤치마크가 왜 정직한지, 그리고 무엇...
Andrej Karpathy가 X에 남긴 LLM 코딩의 네 가지 실패 모드 관찰과, Forrest Chang이 이를 Claude 스킬(karpathy-guidelines)로 증류한 행동 지침을 함께 읽고, 네 원칙이 어떻게 관찰과 1:1로 대응하는지, 그리고 이것이 왜 프롬프트가 아니라 운영 규율인지를 정리한다.
DBOS의 Peter Kraft가 쓴 'Postgres is All You Need for Durable Workflows'를 읽고, Temporal 같은 외부 오케스트레이터 대신 Postgres를 직접 백킹 스토어로 쓰는 durable execution 아키텍처와 그 단순성·관측성·신뢰성 논거를 개발자 관점에서 분석·정리한다.
Anthropic 데이터 사이언스·엔지니어링 팀이 쓴 'How Anthropic enables self-service data analytics with Claude'를 읽고, agentic 분석의 정확도가 코드 생성이 아니라 거버넌스된 데이터 기반·구조화된 검색·skill·검증에서 나온다는 4계층 스택을 개발자 관점에서 분석·정리한다.
Addy Osmani의 'The Intent Debt'를 읽고, 기술 부채·인지 부채·의도 부채로 나누는 Triple Debt 모델과 '에이전트가 유일하게 대신 갚아줄 수 없는 부채는 의도 부채'라는 주장을 개발자 관점에서 분석·정리한다.
Anthropic의 'Paving the way for agents in biology'를 읽고, 바이러스 데이터 검색에 결정론적 실행 계층(gget virus)을 더했더니 모델 교체보다 정확도·재현성이 더 크게 좋아졌다는 발견을 개발자 관점에서 분석·정리한다.
Rsgm's Blog의 'My Homelab AI Dev Platform'을 읽고, OpenCode 코딩 에이전트를 격리된 VM에 두고 PR 리뷰와 GitOps로 인프라 변경을 안전하게 흘려보내는 self-hosted AI 개발 파이프라인을 개발자 관점에서 분석·정리한다.
Beyond Vibe Coding 저자 Addy Osmani가 쓴 'Loop Engineering'을 읽고, 에이전트를 직접 프롬프트하는 대신 에이전트를 프롬프트하는 루프를 설계한다는 전환과 그 다섯 구성 요소를 개발자 관점에서 분석·정리한다.
Martin Fowler 사이트에 실린 Thoughtworks의 PRINCE 사례 연구를 읽고, 프로덕션 agentic AI의 신뢰성을 만드는 두 축 — context engineering과 harness engineering — 을 개발자 관점에서 분석·정리한다.