Skip to content

Latest

천천히 올바르게. AI Researcher & DevOps Engineer Youngju's blog. GPU/CUDA, LLM, MLOps, Kubernetes AI workloads, and data engineering — plus mindset essays on confidence, routines, health, and sport psychology.

어학학습48편 표시 중
aiNEW

우리 서비스용 평가셋 만들기 — 트래픽 수집부터 통계적 유의성 판정까지

공개 벤치마크는 우리 문제를 대신 재 주지 않습니다. 입력 분포도, 정답의 정의도, 실패의 비용 구조도 다르기 때문입니다. 이 글은 실제 트래픽에서 사례를 건져 올려 실패 유형별로 층화하고, 정답을 정의할 수 없는 과제에 루브릭을 씌우고, 채점 스크립트를 붙이는 과정을 실제 코드로 따라갑니다. 예시가 몇 개면 충분한지 신뢰구간으로 감을 잡고, 작은 평가셋에서 두 모델의 5퍼센트포인트 차이가 통계적으로 의미 있는지 McNemar 검정과 부트스트랩으로 판정하는 방법까지 다룹니다. 마지막으로 평가셋을 CI에 붙이는 법, 오염을 막는 법, 그리고 평가셋 자체가 낡는 문제를 정리합니다.

aiNEW

텍스트·이미지·에이전트를 각각 어떻게 재는가 — 세 영역의 측정이 근본적으로 다른 이유

텍스트·이미지·에이전트는 같은 "성능"이라는 단어를 쓰지만 측정 구조가 전혀 다릅니다. 텍스트는 정답이 있는 척하는 객관식과 정답이 없는 생성형으로 갈라지고, 이미지는 분포 거리와 사람 판단이 어긋나며, 에이전트는 부분 성공·환경 상태·비결정성 때문에 애초에 하나의 숫자로 압축되지 않습니다. 이 글은 각 영역의 대표 지표가 실제로 계산하는 값을 정의 수준에서 뜯어보고, 영역마다 "지표는 높은데 실제로는 나쁜" 사례를 하나씩 붙였습니다. 마지막에 영역·과제·지표·놓치는 것을 한 장의 표로 정리합니다.