천천히 올바르게. AI Researcher & DevOps Engineer Youngju's blog. GPU/CUDA, LLM, MLOps, Kubernetes AI workloads, and data engineering — plus mindset essays on confidence, routines, health, and sport psychology.
Airbnb 엔지니어링이 2026년 7월에 공개한 평가 주도 개발 회고는 평가셋을 먼저 쓰라는 이야기가 아니라, 채점하는 모델부터 계측기로 인정받아야 한다는 이야기에 가깝습니다. 이 글은 심사자 모델을 골든셋 50~100개로 보정하는 절차, 일치도를 단순 정확도가 아니라 카파로 재야 하는 이유, 그리고 보정되지 않은 심사자가 어떻게 팀 전체를 잘못된 방향으로 최적화시키는지를 실행 가능한 코드와 함께 정리합니다.
ICML 2026 입장 논문 Position: LLMs can not jump은 생성형 AI가 귀납을 마스터했고 연역을 빠르게 정복하는 중이지만, 새로운 설명 가설을 만들어 내는 귀추에는 구조적으로 도달하지 못한다고 주장합니다. 이 글은 그 주장을 요약하는 대신, 그것이 사실이라고 가정했을 때 우리가 지금 만드는 시스템의 설계를 어떻게 바꿔야 하는지를 다룹니다. 가설 공간을 어디서 공급할 것인가, 제안과 반증을 왜 분리해야 하는가, 그리고 논문이 입장 논문이라는 사실을 어떻게 감안해서 읽어야 하는가입니다.