每日简报 · 2026-08-28

周五 · arXiv / 一线公司博客 / Hacker News · 生成于 2026-08-28 09:00 AEST

📄 arXiv 论文

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
让视觉生成本身成为推理媒介,而非仅是输入输出的中间产物;构建可扩展可验证的训练评测套件。方向新颖但离落地工程较远,可关注其验证框架设计思路。
2026-08-26 · cs.CV cs.AI · Junxiang Xu、Ruisi Wang、Fanyi Pu等 · 原文
MyoMechanix: Biomechanically-Grounded Compositional Skilled Activity Understanding and Coaching
把肌肉力学等生理信号接入动作质量评估,替代纯视觉/姿态的单一建模方式。属于垂直领域多模态数据集,与通用agent工程关联不大。
2026-08-26 · cs.CV cs.AI · Hao Yin、Paritosh Parmar、Lijun Gu等 · 原文
Agentic Autoresearch for Cell-Edge Power Control: Radically Redefining the Researcher's Role
让AI agent自主编辑训练脚本、跑实验、调无线资源管理算法,把研究设计环节整体交给agent。是自动化科研agent的一个实例,可参考其固定预算实验的评估范式。
2026-08-26 · cs.LG cs.IT · Ahmad Khan、Akram Bin Sediq、Sara Azadegi Naeini等 · 原文
PlanSightRAG: A Visual-First Multimodal RAG for Automating Question Answering and Compliance Checking for Civil Standard Plans
针对工程图纸做视觉优先的多模态RAG,直接在图像上检索推理而非先OCR再检索。视觉优先RAG的思路值得agent工具链中处理版面敏感文档时借鉴。
2026-08-26 · cs.IR cs.CL · Nabaraj Subedi、Shuvo Dip Datta、Ahmed Abdelaty等 · 原文
TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development
拆解人类与agent在机器学习开发中的规划过程差异,指出agent在长周期迭代决策上仍显著弱于人类,而非只看最终提交结果打分。对理解长程agent的规划瓶颈很有参考价值,值得细读。
2026-08-26 · cs.LG cs.AI · Jiarui Yan、Weiwei Sun、Sijie Li等 · 原文

🏢 一线公司博客

今天该板块没有可报的内容(今天没有符合条件的内容)。

🔥 Hacker News 高分

今天该板块没有可报的内容(今天没有符合条件的内容)。

💬 Talks 引子

长程agent为什么总是规划不过人类

结合i5对ML开发过程的实证分析和i3的自动科研agent实践,聊聊agent在多步迭代决策中到底卡在哪,对做长程工作流的人有直接借鉴意义。

引子来自:Agentic Autoresearch for Cell-Edge Pow · TraceML: An Empirical Analysis of Huma