🎯 问题与形式化
延迟敏感任务里奖励按推理延迟之后的环境状态计分:r=R(a_{t+Δt}|E_{t+Δt})——评的不只是决定什么,还有决定花多久。
两个新基准:HFTBench(Polygon.io 历史逐秒行情回测,延迟经排队式成交模型线性折算成成交价劣势)与 StreetFighter(DIAMBRA 平台真实时对战 + RTX 5090 本地实测推理延迟,ELO 计分)。所有延迟都是物理实测,非模拟。
关键环境细节:街霸每个角色动作有固定的游戏内耗时,有效动作率上限约 5 次/秒(200ms/动作)——延迟压到 200ms 以下无增益,游戏机制本身设定了有效响应率的上限。HFT 中所有 agent 拿同样的同步观测窗,隔离信息差,只测延迟效应。
📊 两任务方向相反
街霸:3B+FPX(195ms) ELO 5.99 第一、14B FP16 垫底 −5.94。HFT:14B 最好 +26.52%、7B 全负且越快亏越多(−3.28→−7.25→−12.94)。
街霸是延迟主导:1.5B FP8 最快(142ms)但太笨(ELO −1.25),14B 最聪明但最慢垫底——3B 中庸+压缩是甜点。HFT 是质量主导:小模型识别不了获利模式,14B γ=0.2 压缩后 713ms 反超 FP8/FP16 版本;而 7B 本来就亏,加速后亏得更快(快而错比慢而错更贵)。
倒 U 曲线(3B+FPX vs 3B-FP16 对战胜率随压缩比 γ):γ=0 (222ms) 72.5% → γ=0.2 77.5% → γ=0.3 (200ms) 80% 峰值 → γ=0.4 62.5% → γ=0.6 12.5%(PPL 17.4 质量崩)→ γ≥0.8 0%。任务特定最优点:HFT 14B 在 γ=0.2、街霸 3B 在 γ=0.3——'最优延迟-质量点因任务而异'有干净扫描背书。
🔧 FPX
层级自适应 FP8/FP4 混合精度:离线校准逐层 FP4 误差,给最耐压的 γL 层降到 FP4、其余保 FP8,连续细粒度控制延迟。
因为 transformer 线性层的 FP4 替换延迟收益近似均匀,精度分配可以只优化质量损失。Wikitext-2 上一次性校准。对比基线排除一切比 FP8 慢的量化方案(W4A16 的反量化开销在延迟敏感场景是负资产)。
这是硬件侧的'额定速度'原型:给定延迟目标,在模型尺寸×层级位宽的空间里找质量最优配置。局限:单模型族(Qwen2.5)、静态校准不在线调整、HFT 无市场冲击建模(延迟只折价格不改变市场——ABIDES 式内生反应缺失)。
💡 对主线的启示
'延迟-质量权衡真实存在且非单调'最硬证据;它扫系统侧延迟、我们扫环境侧时钟——同一权衡两个旋钮。
三点:① 两任务方向相反支撑调速阶梯必须分场景报告;② 倒 U 是额定速度概念的系统侧原型(存在任务特定崩溃点);③ 快端设计要对齐环境动作吞吐上限(街霸 200ms 教训)。细节弹药:'快而错比慢而错更贵'(7B HFT 越快亏越多)。
与近邻的正交性:RealtimeGym 用 token 计价扫环境压力(无真实系统延迟)、本文用真实系统延迟扫模型配置(环境节奏固定)——我们的位置是第三轴:固定模型、扫环境时钟。三者合起来构成延迟-质量问题的完整实验设计空间。