AI Insight Feed
最具技术趋势的信息流,和你一起探索拥有了 AI 的有趣世界 🚀
a
Jilin University · King Abdullah University of Science and Technology (KAUST) · University of Alberta · The Swiss AI Lab IDSIA · USI · SUPSI
arXiv
Research source
Self-Improvements in Modern Agentic Systems: A Survey
现有综述将模型微调与脚手架改进割裂讨论,缺乏统一视角。本文将自我改进形式化为对模型参数或脚手架组件的自诱导更新算子,归纳为基础模型改进与脚手架改进两条路径,并按更新目标与驱动信号建立分类框架。综述覆盖软件工程、网页自动化、科学发现等场景,指出评测协议与可控性仍是开放问题。值得关注的是,从经典自引用系统到现代基础模型 Agent,提供按“更新什么”和“由什么信号驱动”组织的自我改进全景图。
F
Frontis.AI
Research source
Self-Improving Agents in the Era of Experience: A Survey of Self- to Meta-Evolution
传统智能体依赖静态预训练权重,难以应对部署后的环境漂移与长程任务。本文以运行外壳(harness)为核心,系统梳理经验向技能、记忆、环境、参数与元层五个可更新部分转化的机制,并提出 SIP-Bench 纵向评测协议与双层安全框架。外部路径如技能注入在 SkillsBench 上平均增益 +16.2 个百分点,但 16/84 任务出现负迁移,全局安全边界仍是开放问题。
a
伊利诺伊大学厄巴纳-香槟分校
arXiv
Research source
ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning
大语言模型虽支持超长上下文,却常忽略输入中已有的关键证据。ReContext 利用模型内部注意力信号,在多轮推理中递归筛选并回放相关证据片段,同时保留完整原文。在 8 个 128K 数据集和 Qwen3、Llama3 等模型上,该方法平均排名最优,准确率相对提升约 24.6%,且无需训练或修改模型参数。
a
arXiv
Research source
LLM-as-a-Verifier: A General-Purpose Verification Framework
现有 LLM 评判器将评分压成离散整数,导致复杂方案频繁打平、难以区分。本文提出 LLM-as-a-Verifier,通过计算评分 token 的 logit 期望获得连续分数,并在粒度、重复评估和标准分解三个维度扩展验证能力。该方法无需额外训练,在 Terminal-Bench V2、SWE-Bench Verified 等四个基准上均达到当前最优。 把“验证”做成可扩展轴:用 logit 期望替代离散评分,并用三轴扩展和低成本排序算法同时提升区分度与实用性。 提出 LLM-as-a-Verifier:通过提取评分 token 的 logit 分布并计算期望,得到连续奖励,而不是离散分数。框架沿三个维度扩展验证:评分粒度、重复评估和标准分解。为在有限预算下从多个候选中选出最优轨迹,提出 Probabilistic Pivot Tournament,通过环状初筛选择 pivot,将比较集中在头部不确定候选上,把比较成本从 O(N²) 降到 O(Nk)。
a
arXiv
Research source
A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets
线性注意力以固定循环状态实现 O(1) 内存,却因多键值竞争覆盖早期事实而丢失精确召回。HOLA 在 delta-rule 状态外引入有界精确 KV 缓存,以写幅值作为驱逐分数保留 top-w token,并用解耦 RMSNorm-γ 恢复尖锐检索。340M 模型在 Wikitext 困惑度从 27.32 降至 22.92,优于全注意力 Transformer++,并在 32k RULER 大海捞针任务中保持 0.58 召回率。 利用 delta-rule 内在的写幅值信号作为无参数驱逐策略,使线性注意力模型在保持 O(1) 状态的同时恢复精确召回能力 HOLA(Hippocampal Linear Attention)将记忆读取形式化为半参数化测试时回归:循环状态作为参数化估计器处理线性可压缩结构,有界精确 KV 缓存作为非参数修正存储不应被状态吸收的键值对。缓存写入无需额外学习模块,直接利用 delta-rule 已计算的写幅值 β·∥e∥(写强度与残差范数的乘积)作为驱逐分数,保留对状态改变最大的 top-w 个 token;读取路径采用解耦的 RMSNorm-γ 归一化,将缓存 logit 从接近均匀分布恢复为尖锐的近似 argmax 检索,同时保持状态更新路径的单位范数稳定性。该方法在 Gated DeltaNet(GDN)骨干上实例化,每层仅增加约 12,480 个可学习标量(不足模型参数的 0.004%)。
斯
斯坦福大学
Official insight
The Global AI Vibrancy Tool 2025 | Stanford HAI
这篇来自Stanford的专题解读主要围绕《The Global AI Vibrancy Tool 2025 | Stanford HAI》展开,适合快速了解这家团队最近在关注什么方向。
A
Anthropic
Official insight
A global workspace in language models
该研究旨在通过可解释性方法探索语言模型 Claude 的内部思维,提出可能存在全局工作空间的信息整合机制,但具体方法与实验结果未在摘要中披露,其核心贡献在于对模型内部表征机制的可解释性尝试。值得关注的是,首次将认知科学中的全局工作空间概念引入 Claude 内部思维的可解释性研究...
O
OpenAI
Official insight
Why teens deserve access to safe AI
了解OpenAI如何通过适合青少年年龄的保护措施、学习工具、家长控制和专家合作伙伴关系,为青少年提供更安全的ChatGPT。