logo
|
Blog

    Plaid Labs Blog

    AI가 실제로 일하게 만드는 과정의 기록
    조태완's avatar
    조태완
    AI Agent는 왜 KV Cache가 중요한가: vLLM과 LMCache로 반복 문맥 비용 줄이기

    AI Agent는 왜 KV Cache가 중요한가: vLLM과 LMCache로 반복 문맥 비용 줄이기

    Codex·Claude Code·Hermes Agent처럼 긴 공통 문맥을 반복하는 AI Agent에서 KV Cache와 LMCache가 TTFT와 GPU 비용을 줄이는 원리를 정리합니다.
    조태완's avatar
    Aug 07, 2026
    Engineering
    LLM을 작게 만드는 여러가지 압축 기술들

    LLM을 작게 만드는 여러가지 압축 기술들

    BitNet, AutoRound, TurboQuant, REAP 네 가지 LLM 압축 기법의 메커니즘과 NVFP4와의 직교 결합 운영 가이드. 양자화 너머 가중치·KV·expert pruning까지 다루는 시리즈 5편.
    조태완's avatar
    May 12, 2026
    Engineering
    LLM의 추론속도를 빠르게 만드는 비결, Speculative Decoding이란 무엇인가?

    LLM의 추론속도를 빠르게 만드는 비결, Speculative Decoding이란 무엇인가?

    Speculative Decoding 원리부터 n-gram·Medusa·EAGLE-3·MTP·DFlash까지 2026 LLM 추론 가속 기법을 한 번에 정리. NVFP4 양자화와의 이중 가속, vLLM·SGLang 실전 활성화까지 다룹니다.
    조태완's avatar
    May 12, 2026
    Engineering
    오픈소스 LLM 동향 2026: 
DeepSeek-V4·Qwen3.6·GLM-5.1

    오픈소스 LLM 동향 2026: DeepSeek-V4·Qwen3.6·GLM-5.1

    TEST MARKER 2026-05-11 — inblog API PATCH 진단용
    조태완's avatar
    May 11, 2026
    Engineering
    개인용 로컬 LLM 추론의 새 기준, MLX

    개인용 로컬 LLM 추론의 새 기준, MLX

    Mac mini M4 Pro 24GB에서 MLX로 30B급 LLM을 실제로 돌려본 벤치마크와 운영 노하우. 개인용/소규모 팀의 로컬 LLM 추론 기준선을 정리합니다.
    조태완's avatar
    May 06, 2026
    Engineering
    플래드랩스, 2026년 창업지원사업 잇단 선정

    플래드랩스, 2026년 창업지원사업 잇단 선정

    NUVION의 제조 현장 적용과 사업화 검증을 본격화합니다.
    조태완's avatar
    Apr 22, 2026
    Company
    NVIDIA Blackwell 전용 추론 엔진 NVFP4를 활용한 vLLM 로컬 모델 서빙

    NVIDIA Blackwell 전용 추론 엔진 NVFP4를 활용한 vLLM 로컬 모델 서빙

    NVFP4를 쉬운 비유와 실전 예시로 설명하고, Blackwell 듀얼 GPU에서 vLLM 로컬 서빙을 안정적으로 운영하는 방법을 정리한 가이드입니다.
    조태완's avatar
    Feb 07, 2026
    Engineering

    플래드랩스

    RSS·Powered by Inblog