TokenSpeed服务器参数详解:12个关键启动参数如何决定你的推理性能 TokenSpeed服务器参数详解12个关键启动参数如何决定你的推理性能【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeedTokenSpeed 是一个光速 LLM 推理引擎而它的推理性能在很大程度上由启动时的服务器参数决定。本文将从模型加载、并行策略、调度与显存、内核后端四大维度带你逐一看懂 12 个最关键的 TokenSpeed 启动参数帮助新手快速搭建出吞吐与延迟都在线的 OpenAI 兼容服务。官方完整参数表见 docs/configuration/server.md参数定义源码位于 python/tokenspeed/runtime/utils/server_args.py。一、最小启动命令先跑通再说所有参数都通过tokenspeed serve传入模型路径直接跟在命令后面tokenspeed serve openai/gpt-oss-20b \ --host 0.0.0.0 \ --port 8000 \ --tensor-parallel-size 1启动后即为 OpenAI 兼容 HTTP 服务客户端用base_urlhttp://localhost:8000/v1即可直连。完整启动流程参考 docs/guides/launching.md。二、模型加载类参数性能的地基1.model位置参数与--tokenizermodel接受本地路径或模型仓库 ID是整个服务的第一参数--tokenizer可在分词器路径与模型路径不一致时单独指定。--trust-remote-code则用于加载模型仓库自带的自定义代码。2.--dtype与--kv-cache-dtype精度决定显存与速度--dtype控制权重与激活精度auto跟随模型元数据--kv-cache-dtype fp8可显著降低 KV 缓存显存占用是长上下文部署的常见选择。权重侧还可以用--quantization如nvfp4、fp8进一步压缩加载体积——量化模型往往能直接换用更大的 KV 池从而提升并发能力。上图展示了不同 TP/EP 组合下TokenSpeed 在各负载点的吞吐表现参数配比直接影响曲线上的每个点。三、并行类参数显卡拓扑决定吞吐上限3.--tensor-parallel-size别名--tp最熟悉的张量并行入口简单部署首选tokenspeed serve model --tensor-parallel-size 8注意TokenSpeed 中该参数默认映射到注意力 TP当注意力、稠密层、MoE 层需要不同进程组时改用拆分旋钮--attn-tp-size/--dense-tp-size/--moe-tp-size细节见 docs/serving/parallelism.md。4.--data-parallel-size数据并行副本数适合 MLA 等每 rank 独立持 KV的布局把空闲算力变成更多并发副本。5.--enable-expert-parallel别名--ep-size为 MoE 模型开启专家并行把不同专家分布到不同 GPU减少单卡权重冗余。生产示例tokenspeed serve nvidia/Kimi-K2.5-NVFP4 \ --trust-remote-code \ --max-model-len 262144 \ --kv-cache-dtype fp8 \ --quantization nvfp4 \ --tensor-parallel-size 4 \ --enable-expert-parallel两张图分别说明注意力与 MoE 内核的实现选择在不同批次下能带来成倍的吞吐或延迟差异——这正是下面两个后端参数的意义。四、调度与显存类参数稳定性的开关6.--max-model-len最大序列长度。省略时取模型配置值显存紧张时适当调低它是第一优先手段。7.--gpu-memory-utilization模型权重 KV 缓存占用的 GPU 显存比例。留出余量可避免峰值 OOM调低它会直接缩小 KV 池因此先定它再调并发。8.--max-num-seqs调度器可同时处理的最大序列数是并发上限的直接阀门。9.--chunked-prefill-size调度器单轮迭代可发放的 token 预算默认 8192来自其他引擎的--max-num-batched-tokens配方应翻译到它上面设-1可禁用分块 prefill。10.--enable-prefix-caching开启前缀缓存复用多轮对话、Agent 场景下能大幅削减重复 prefill直接降低 TTFT。五、后端与加速类参数把内核榨干11.--attention-backend与--moe-backend显式指定注意力 / MoE 内核后端如trtllm_mla、flashinfer_trtllm等。官方建议生产环境写死后端名而不是auto这样基准对比和回归排查才有确定性。12.--speculative-config系列投机解码是 decode 阶段加速的最大杠杆--speculative-algorithmEAGLE3、MTP、DFLASH、DSPARK 草稿模型路径 步数/草稿 token 数。推荐用--speculative-config一次性传入 JSON 配置把方法、草稿模型、token 数绑定在一起。辅助开关--enforce-eager可关闭 CUDA Graph 执行便于调试内核级问题问题定位完记得去掉它恢复图执行。六、一分钟速查清单参数一句话作用典型值model模型路径/仓库 IDopenai/gpt-oss-20b--kv-cache-dtypeKV 缓存精度省显存fp8--tensor-parallel-size张量并行宽度4/8--data-parallel-size数据并行副本数2--enable-expert-parallelMoE 专家并行开关--max-model-len最大序列长度262144--gpu-memory-utilization显存占用比例0.9--max-num-seqs最大并发序列256--chunked-prefill-size单轮 prefill 预算8192--enable-prefix-caching前缀缓存复用开关--attention-backend注意力内核后端trtllm_mla--speculative-config投机解码配置JSON调参顺序建议先定--max-model-len与--gpu-memory-utilization→ 再配并行参数匹配硬件拓扑 → 最后调--max-num-seqs、--chunked-prefill-size与后端。更多实战配方Kimi K3、DeepSeek、Qwen 等见 docs/recipes/models.md参数兼容对照表见 docs/configuration/compatible-parameters.md。【免费下载链接】tokenspeedTokenSpeed is a speed-of-light LLM inference engine.项目地址: https://gitcode.com/gh_mirrors/to/tokenspeed创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考