Skip to content

Latest

천천히 올바르게. AI Researcher & DevOps Engineer Youngju's blog. GPU/CUDA, LLM, MLOps, Kubernetes AI workloads, and data engineering — plus mindset essays on confidence, routines, health, and sport psychology.

놀면서 배우기

전체 보기 →

자주 찾는 도구

전체 보기 →
어학학습48편 표시 중
컬처·트렌드NEW

Cerebras Ultrafast와 에이전트 루프의 병목 — 초당 750토큰이 줄이지 못하는 시간

Cerebras와 OpenAI가 초당 최대 750토큰을 내는 추론 티어를 공개했습니다. 발표문이 밝히는 원리는 연산량이 아니라 데이터 이동이고, 가중치를 웨이퍼 위 SRAM에 올려 두는 방식입니다. 왜 배치 1의 디코딩이 메모리 대역폭에 묶이는지, 발표된 배속 수치가 무엇을 재고 무엇을 재지 않는지, 그리고 토큰 생성이 빨라져도 줄지 않는 시간이 여러분의 에이전트 루프에서 몇 퍼센트인지 계산하는 방법을 정리합니다.

컬처·트렌드NEW

DeepSeek Harness의 플러그인 커널 구조 — 되감을 수 있는 에이전트는 무엇이 다른가

DeepSeek이 공개한 오픈소스 코딩 에이전트 Harness는 모델도 도구도 UI도 전부 플러그인으로 만든 구조입니다. 그런데 실제로 흥미로운 부분은 플러그인이라는 단어가 아니라 두 가지 설계 결정입니다. 하나는 모든 실행을 추가 전용 이벤트 로그로 남겨 재개·분기·재생을 같은 스트림 위에서 처리한다는 것이고, 다른 하나는 플러그인 해제 시 부수 효과를 되돌리도록 강제한다는 것입니다. 이 구조가 무엇을 가능하게 하는지, 그리고 플러그인 생태계에 대한 오래된 반론이 왜 여전히 유효한지 정리합니다.