每日简报 · 2026-08-26

周三 · arXiv / 一线公司博客 / Hacker News · 生成于 2026-08-26 09:00 AEST

📄 arXiv 论文

How to Train a Critic Stably and Efficiently
研究critic式RL训练不稳定的原因,提出BPCO训练配方替代GRPO多采样估计优势。价值:偏RL训练侧,和上下文/工具链关系较远,可选读。
2026-08-24 · cs.LG cs.AI · Penghui Qi、Xiangxin Zhou、Wee Sun Lee · 原文
ReWorld: An Interactive World Model with Long-Horizon Memory
交互式世界模型用混合分头注意力窗口,训练时短程控制长程记忆分离,推理时定界。价值:分头分工思路可类比agent记忆分层设计。
2026-08-24 · cs.AI · Zhifei Chen、Luozhou Wang、Guibao Shen等 · 原文
SWE Refactor Bench: Can Coding Agents Complete a Long-Horizon, Whole-Repository Stack Migration?
提出全仓库技术栈迁移benchmark,专门检验迁移是否真发生而非只看行为正确性。价值:直接命中长程coding agent评测痛点,建议细读。
2026-08-24 · cs.CL cs.AI · Deyao Hong、Yizhe Chi、Wenyi Li等 · 原文
Prime Agent: A Self-Improving RLM Harness
开源长程agent harness,持久REPL加递归语言模型做程序化上下文处理与测试时计算。价值:工具链与工作流设计的直接参考对象。
2026-08-24 · cs.AI cs.CL · Seth Karten、Alex L. Zhang、Kevin Thomas等 · 原文
How AI Assistance Affects Human Skill Development: A Study of Learning with Logic Puzzles
逻辑谜题实验发现AI辅助成本越低,使用者技能提升反而越差。价值:提醒agent产品设计要权衡效率与用户能力留存。
2026-08-24 · cs.AI · Shang Wu、Catarina G Belem、Shuyuan Fu等 · 原文

🏢 一线公司博客

今天该板块没有可报的内容(今天没有符合条件的内容)。

🔥 Hacker News 高分

今天该板块没有可报的内容(今天没有符合条件的内容)。

💬 Talks 引子

长程agent的记忆、评测与工具链怎么各自破局

同一天出现分头注意力做记忆分层、检验迁移是否真发生的benchmark、递归REPL式harness三种思路,正好对照讲长程agent工程的不同切法。

引子来自:ReWorld: An Interactive World Model wi · SWE Refactor Bench: Can Coding Agents · Prime Agent: A Self-Improving RLM Harn