Avatar

Jiangwan's Blog

Bug 也是一种艺术

  1. 主页
  2. 关于
  3. 归档
  4. 搜索
  5. 链接
    1. 暗色模式

归档

2026 20
人工智能

长上下文推理优化:Prefix Cache、调度与 MTP

在 100K Context 已经装得下之后,继续拆解 Prefix Cache、Chunked Prefill、Continuous Batching 与 MTP 分别优化哪一段延迟和吞吐。

8月 28, 2026
阅读时长: 11 分钟
人工智能

200K Context 到底需要多少显存?从 KV Cache 算到 Qwen3.8 的真实部署

结合 Qwen3.8-27B 的 GQA 与 Hybrid Attention 结构重新计算 KV Cache,并解释为什么理论 200K 可算、实际生产配置最终停在 100K FP8 KV。

8月 28, 2026
阅读时长: 9 分钟
人工智能

为什么生产推理我默认 vLLM:从 NVFP4、Kernel 到 CUDA Graph

从 Qwen3.8-Flash-Next 的 CPU Offload 到 27B 的全 GPU Serving,解释为什么生产推理更看重 NVFP4 Kernel、Compile、CUDA Graph 与调度执行链。

8月 28, 2026
阅读时长: 10 分钟
人工智能

两张 RTX 5060 Ti 为什么没有两倍推理速度?显存带宽、PCIe 与 P2P

结合 TP2 单流 33.5 token/s、无 CUDA P2P 的实测环境,分析双卡显存带宽、PCIe、Collective 延迟与最终 Scaling 之间的关系。

8月 25, 2026
阅读时长: 8 分钟
人工智能

双卡部署大模型:TP、PP、DP 和 Layer Split 到底有什么区别?

从双卡 27B 部署出发,拆清 Layer Split、PP、TP 和 DP 分别在切什么,以及它们对容量、单流性能和并发吞吐的真实影响。

8月 24, 2026
阅读时长: 7 分钟
1 2 3 4
© 2026 Jiangwan's Blog
使用 Hugo 构建
主题 Stack 由 Jimmy 设计