每日简报 · 2026-08-26
周三 · arXiv / 一线公司博客 / Hacker News · 生成于 2026-08-26 09:00 AEST
📄 arXiv 论文
研究critic式RL训练不稳定的原因,提出BPCO训练配方替代GRPO多采样估计优势。价值:偏RL训练侧,和上下文/工具链关系较远,可选读。
2026-08-24 · cs.LG cs.AI · Penghui Qi、Xiangxin Zhou、Wee Sun Lee ·
原文
交互式世界模型用混合分头注意力窗口,训练时短程控制长程记忆分离,推理时定界。价值:分头分工思路可类比agent记忆分层设计。
2026-08-24 · cs.AI · Zhifei Chen、Luozhou Wang、Guibao Shen等 ·
原文
提出全仓库技术栈迁移benchmark,专门检验迁移是否真发生而非只看行为正确性。价值:直接命中长程coding agent评测痛点,建议细读。
2026-08-24 · cs.CL cs.AI · Deyao Hong、Yizhe Chi、Wenyi Li等 ·
原文
开源长程agent harness,持久REPL加递归语言模型做程序化上下文处理与测试时计算。价值:工具链与工作流设计的直接参考对象。
2026-08-24 · cs.AI cs.CL · Seth Karten、Alex L. Zhang、Kevin Thomas等 ·
原文
逻辑谜题实验发现AI辅助成本越低,使用者技能提升反而越差。价值:提醒agent产品设计要权衡效率与用户能力留存。
2026-08-24 · cs.AI · Shang Wu、Catarina G Belem、Shuyuan Fu等 ·
原文
🏢 一线公司博客
今天该板块没有可报的内容(今天没有符合条件的内容)。
🔥 Hacker News 高分
今天该板块没有可报的内容(今天没有符合条件的内容)。
💬 Talks 引子
长程agent的记忆、评测与工具链怎么各自破局
同一天出现分头注意力做记忆分层、检验迁移是否真发生的benchmark、递归REPL式harness三种思路,正好对照讲长程agent工程的不同切法。