在 100K Context 已经装得下之后,继续拆解 Prefix Cache、Chunked Prefill、Continuous Batching 与 MTP 分别优化哪一段延迟和吞吐。
结合 Qwen3.8-27B 的 GQA 与 Hybrid Attention 结构重新计算 KV Cache,并解释为什么理论 200K 可算、实际生产配置最终停在 100K FP8 KV。
从 Qwen3.8-Flash-Next 的 CPU Offload 到 27B 的全 GPU Serving,解释为什么生产推理更看重 NVFP4 Kernel、Compile、CUDA Graph 与调度执行链。
结合 TP2 单流 33.5 token/s、无 CUDA P2P 的实测环境,分析双卡显存带宽、PCIe、Collective 延迟与最终 Scaling 之间的关系。
从双卡 27B 部署出发,拆清 Layer Split、PP、TP 和 DP 分别在切什么,以及它们对容量、单流性能和并发吞吐的真实影响。