|
Blog
Subscribe
Search posts...
Plaid Labs Blog
AI가 실제로 일하게 만드는 과정의 기록
Subscribe
조태완
AI Agent는 왜 KV Cache가 중요한가: vLLM과 LMCache로 반복 문맥 비용 줄이기
Codex·Claude Code·Hermes Agent처럼 긴 공통 문맥을 반복하는 AI Agent에서 KV Cache와 LMCache가 TTFT와 GPU 비용을 줄이는 원리를 정리합니다.
Aug 07, 2026
Engineering
LLM을 작게 만드는 여러가지 압축 기술들
BitNet, AutoRound, TurboQuant, REAP 네 가지 LLM 압축 기법의 메커니즘과 NVFP4와의 직교 결합 운영 가이드. 양자화 너머 가중치·KV·expert pruning까지 다루는 시리즈 5편.
May 12, 2026
Engineering
LLM의 추론속도를 빠르게 만드는 비결, Speculative Decoding이란 무엇인가?
Speculative Decoding 원리부터 n-gram·Medusa·EAGLE-3·MTP·DFlash까지 2026 LLM 추론 가속 기법을 한 번에 정리. NVFP4 양자화와의 이중 가속, vLLM·SGLang 실전 활성화까지 다룹니다.
May 12, 2026
Engineering
오픈소스 LLM 동향 2026: DeepSeek-V4·Qwen3.6·GLM-5.1
TEST MARKER 2026-05-11 — inblog API PATCH 진단용
May 11, 2026
Engineering
개인용 로컬 LLM 추론의 새 기준, MLX
Mac mini M4 Pro 24GB에서 MLX로 30B급 LLM을 실제로 돌려본 벤치마크와 운영 노하우. 개인용/소규모 팀의 로컬 LLM 추론 기준선을 정리합니다.
May 06, 2026
Engineering
플래드랩스, 2026년 창업지원사업 잇단 선정
NUVION의 제조 현장 적용과 사업화 검증을 본격화합니다.
Apr 22, 2026
Company
NVIDIA Blackwell 전용 추론 엔진 NVFP4를 활용한 vLLM 로컬 모델 서빙
NVFP4를 쉬운 비유와 실전 예시로 설명하고, Blackwell 듀얼 GPU에서 vLLM 로컬 서빙을 안정적으로 운영하는 방법을 정리한 가이드입니다.
Feb 07, 2026
Engineering