Text Matrix
技术笔记 行业快讯 视频精读 财富自由 思考与随笔 搜索
Text Matrix
搜索 技术笔记行业快讯视频精读财富自由思考与随笔

 Vllm

2026

colibrì 引擎拆解:在 25GB RAM 上跑 744B MoE 模型,纯 C 实现,比 vLLM-Moet 快 2.5 倍 07-13
allenai/olmocr 深度拆解:把 PDF 线性化为 LLM 训练 token 的 7B VLM 流水线 07-01
Ornith-1.0 深度解读:自改进开源 agentic coding 模型,4 个尺寸 + Self-Improving Framework 突破 06-30
Micro-Agent:在 Model API 内部用协作打 frontier model——vLLM Semantic Router 拆解 06-30
EAGLE / EAGLE-2 / EAGLE-3:基于特征外推的 LLM 推测解码全栈指南 06-28
2×GH200 跑 GLM-5.2:从 2.39 tok/s 到 54.92 tok/s,局部性铁律贯穿全文 06-25
LMCache 深度解析:把 LLM 推理的 KV Cache 从临时状态改造成可复用资产 06-13
Odysseus:一站式自托管 AI 工作台,把 ChatGPT/Claude 体验搬回本地 06-04
MinivLLM:从零理解vLLM推理引擎的完整指南 05-12
RTX 3090 本地运行 LLM 实战:vLLM 与 llama.cpp 双引擎对比 04-29
DFlash:块扩散模型加速LLM推理——让大模型推理速度提升2-3倍 04-17
Pi Monorepo:开源 AI Agent 工具包专家级技术文档 03-30
关于 · 隐私政策 · 联系
由 Hugo 强力驱动 | 主题 - LoveIt
 TextMatrix