Agent 与 LLM Inference 论文的全文精读:机制、核实过的数字、摘要没说的事。
在解决:长程 coding agent 的上下文会涨到几百万 token,如何压缩上下文,既不丢关键信息、又不让每一步都重新 prefill 而烧钱。
机制可信、值得抄,但 headline 数字普遍被说大了:省钱扎实,「性能不降反升」在种子噪声内,「匹配 Opus 4.7」「超专用方法 25%」都是跨 harness / 跨模型比较。
在解决:本地服务栈在模型运行前拒绝或修改请求,在工具调用评估中产生了未知的混淆,导致评估者将基础设施故障误认为模型能力不足。
论文证明了 0% 的工具调用率通常是服务栈的假象,而非模型本身能力的缺失。然而,该测量受到极小分母和高方差的限制,这意味着这些数据仅能凸显服务层的混淆,而无法用于可靠地对模型能力进行排名。
在解决:通过解决计算密集型预填充阶段和内存带宽密集型解码阶段相互冲突的量化需求,在不牺牲准确率的情况下加速大语言模型推理。
证明了将预填充(原生计算格式)和解码(纯权重格式)的量化解耦可以显著提高准确率和速度,但 SSD 流式加载优化 (ODP) 对 MoE 架构和短上下文请求无效。
在解决:如何使全能模型能够执行诸如视频剪辑和分析等长周期多模态生产力任务,而不会因处理完整长度的视频而产生高昂的 Token 成本。
证明了将全能模型封装在原生智能体框架中可以大幅降低长视频的 Token 消耗并提高推理能力,尽管该模型在几项智能体和视频推理任务上仍落后于 Gemini 3.8 Flash,并且部分核心的多语言翻译能力略有倒退。
在解决:该任务旨在为大型语言模型(LLM)分配测试时算力,以有效发现可验证的算法和数学解,并探究复杂的进化机制是否真的必要。
它表明使用简单贪心更新的 Token 采样比扰动权重或维护复杂种群提供更强、更廉价的探索,尽管其主打的 SOTA 结果依赖于浮点敏感环境下的单一最佳随机种子,并且在缺乏特定领域提示的情况下表现不佳。