Inference Notes · 论文精读

English

Agent 与 LLM Inference 论文的全文精读:机制、核实过的数字、摘要没说的事。

全部 · 5AgentInference
2026-09
AgentInference精读于 2026-09-23 · arXiv 2609.26779

CliffCompaction: Cost-Efficient Compaction for Long-Horizon Coding Agents

Trang Nguyen, Eulrang Cho, Bingqing Chen, Tim Dettmers

在解决:长程 coding agent 的上下文会涨到几百万 token,如何压缩上下文,既不丢关键信息、又不让每一步都重新 prefill 而烧钱。

机制可信、值得抄,但 headline 数字普遍被说大了:省钱扎实,「性能不降反升」在种子噪声内,「匹配 Opus 4.7」「超专用方法 25%」都是跨 harness / 跨模型比较。

可信度: 机制 高 / 成本 中高 / 性能提升 低-中
AgentInference精读于 2026-09-23 · arXiv 2609.26693

Measuring the Serving Stack Instead of the Model: Hidden Confounds in Local Tool-Use Evaluation

Lijuan Tang, Yuemeng Zheng

在解决:本地服务栈在模型运行前拒绝或修改请求,在工具调用评估中产生了未知的混淆,导致评估者将基础设施故障误认为模型能力不足。

论文证明了 0% 的工具调用率通常是服务栈的假象,而非模型本身能力的缺失。然而,该测量受到极小分母和高方差的限制,这意味着这些数据仅能凸显服务层的混淆,而无法用于可靠地对模型能力进行排名。

可信度: 对机制和测量警告的置信度高,但作者明确表示其结果不支持跨模型的能力排名。
Inference精读于 2026-09-23 · arXiv 2609.26333

Disaggregated Quantization: Specializing LLM Prefill and Decode

Andrei Panferov, Maximilian Kleinegger, Sweta Priyadarshi, Tijmen Blankevoort, Dan Alistarh

在解决:通过解决计算密集型预填充阶段和内存带宽密集型解码阶段相互冲突的量化需求,在不牺牲准确率的情况下加速大语言模型推理。

证明了将预填充(原生计算格式)和解码(纯权重格式)的量化解耦可以显著提高准确率和速度,但 SSD 流式加载优化 (ODP) 对 MoE 架构和短上下文请求无效。

可信度: 机制与指标置信度高。1-bit 带来的巨大收益是真实的,但依赖于本身受损严重的纯权重基线;在稠密模型上泛化良好,但不适用于 MoE。
AgentInference精读于 2026-09-23 · arXiv 2609.25611

Qwen3.8-Omni: Towards Native Omni-Modal Agents

Qwen Team

在解决:如何使全能模型能够执行诸如视频剪辑和分析等长周期多模态生产力任务,而不会因处理完整长度的视频而产生高昂的 Token 成本。

证明了将全能模型封装在原生智能体框架中可以大幅降低长视频的 Token 消耗并提高推理能力,尽管该模型在几项智能体和视频推理任务上仍落后于 Gemini 3.8 Flash,并且部分核心的多语言翻译能力略有倒退。

可信度: 对机制和基准测试的胜利置信度高;由于缺乏硬件和服务的消融实验,对确切的成本降低声明置信度中等。
AgentInference精读于 2026-09-23 · arXiv 2609.25510

Hill Sampling for Test-Time Scaling: A Simple and Better Alternative to Repeated Sampling, Evolution, and Training

Jacob Beck, Philip V. Ogren, Ari Kobren

在解决:该任务旨在为大型语言模型(LLM)分配测试时算力,以有效发现可验证的算法和数学解,并探究复杂的进化机制是否真的必要。

它表明使用简单贪心更新的 Token 采样比扰动权重或维护复杂种群提供更强、更廉价的探索,尽管其主打的 SOTA 结果依赖于浮点敏感环境下的单一最佳随机种子,并且在缺乏特定领域提示的情况下表现不佳。

可信度: 机制: 高 (算法简单). 涨点: 中 (3个随机种子,存在浮点敏感性). 泛化性: 中 (仅针对标量数学任务).