Text
Matrix
技术笔记
行业快讯
视频精读
财富自由
思考与随笔
搜索
Text
Matrix
搜索
技术笔记
行业快讯
视频精读
财富自由
思考与随笔
Vllm
2026
colibrì 引擎拆解:在 25GB RAM 上跑 744B MoE 模型,纯 C 实现,比 vLLM-Moet 快 2.5 倍
07-13
allenai/olmocr 深度拆解:把 PDF 线性化为 LLM 训练 token 的 7B VLM 流水线
07-01
Ornith-1.0 深度解读:自改进开源 agentic coding 模型,4 个尺寸 + Self-Improving Framework 突破
06-30
Micro-Agent:在 Model API 内部用协作打 frontier model——vLLM Semantic Router 拆解
06-30
EAGLE / EAGLE-2 / EAGLE-3:基于特征外推的 LLM 推测解码全栈指南
06-28
2×GH200 跑 GLM-5.2:从 2.39 tok/s 到 54.92 tok/s,局部性铁律贯穿全文
06-25
LMCache 深度解析:把 LLM 推理的 KV Cache 从临时状态改造成可复用资产
06-13
Odysseus:一站式自托管 AI 工作台,把 ChatGPT/Claude 体验搬回本地
06-04
MinivLLM:从零理解vLLM推理引擎的完整指南
05-12
RTX 3090 本地运行 LLM 实战:vLLM 与 llama.cpp 双引擎对比
04-29
DFlash:块扩散模型加速LLM推理——让大模型推理速度提升2-3倍
04-17
Pi Monorepo:开源 AI Agent 工具包专家级技术文档
03-30