AOW 速览

AI 前沿 · 具身智能 / 智能汽车 / 智慧补能 · 独立开发与出海

四两拨千斤

三块 RTX 3090 跑起 125B 的 Qwen3.8-Flash-Next:80 tokens/秒

2026-09-28 · AI 前沿 · AI 前沿

默认的 llama.cpp 在三块 RTX 3090 上只能跑 23 tokens/秒:三张卡一共 72GB 显存,约四分之一的专家权重被迫住在系统内存里,PCIe 来回搬运把速度拖垮了。这篇实测用约 400 行 CUDA/C++ 补丁扭转了局面,按激活频率把每层 512 个专家分冷热,再用三档混合精度把它们全塞进显存,速度冲到 80 tokens/秒以上,困惑度只比 8-bit 基线高 1.9%。模型是 Qwen 在 8 月 26 日开源的 Qwen3.8-Flash-Next:125B 参数的 MoE,每次只激活 6B,是 Qwen4 架构的提前预览,SGLang 团队在发布当天做了完整解析。