📅 Last Updated: 2:57:21 AM 📍 Global AI Research
InsightXiv logo

AI 研究助手 · AI Research Assistant

最具技术趋势的信息流,和你一起探索拥有了 AI 的有趣世界 🚀

搜索论文

Search
从站内和网络中找到最相关的论文
Summary
方向总结模式整理中,暂不开放
✨ Pro
⌘↵ Search
30
当前
条目
23
论文
条目
7
博客
播客

AI Insight Feed

最具技术趋势的信息流,和你一起探索拥有了 AI 的有趣世界 🚀
Frontis.AI Research source

Self-Improving Agents in the Era of Experience: A Survey of Self- to Meta-Evolution

收录:2026-07-10 作者:Che Jiang, Jincheng Zhong, Yu Fu, Kai Tian, Junlin Yang, Kaikai Zhao, Yuchong Wang, Tianwei Luo, Weizhi Wang, Yuxin Zuo, Guoli Jia, Xingtai Lv, Dianqiao Lei, Sihang Zeng, Yuru Wang, Zhenzhao Yuan, Xinwei Long, Ermo Hua, Can Ren, Xin Jiang, Shulei Xie, Yuanchun Zheng, Youbang Sun, Biqing Qi, Ning Ding, Kaiyan Zhang, Bowen Zhou Frontis.AI ↗
传统智能体依赖静态预训练权重,难以应对部署后的环境漂移与长程任务。本文以运行外壳(harness)为核心,系统梳理经验向技能、记忆、环境、参数与元层五个可更新部分转化的机制,并提出 SIP-Bench 纵向评测协议与双层安全框架。外部路径如技能注入在 SkillsBench 上平均增益 +16.2 个百分点,但 16/84 任务出现负迁移,全局安全边界仍是开放问题。
Agent 系统
查看论文
新文
Thumbnail
arXiv Research source
伊利诺伊大学厄巴纳-香槟分校

ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning

收录:Recent 作者:Yanjun Zhao, Ruizhong Qiu, Tianxin Wei, Yuanchen Bei, Zhining Liu, Lingjie Chen, Ismini Lourentzou, Hanghang Tong, Jingrui He 机构:伊利诺伊大学厄巴纳-香槟分校
大语言模型虽支持超长上下文,却常忽略输入中已有的关键证据。ReContext 利用模型内部注意力信号,在多轮推理中递归筛选并回放相关证据片段,同时保留完整原文。在 8 个 128K 数据集和 Qwen3、Llama3 等模型上,该方法平均排名最优,准确率相对提升约 24.6%,且无需训练或修改模型参数。
上下文工程
查看论文
新文
Thumbnail
arXiv Research source

LLM-as-a-Verifier: A General-Purpose Verification Framework

收录:2026-07-06 作者:Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini
现有 LLM 评判器将评分压成离散整数,导致复杂方案频繁打平、难以区分。本文提出 LLM-as-a-Verifier,通过计算评分 token 的 logit 期望获得连续分数,并在粒度、重复评估和标准分解三个维度扩展验证能力。该方法无需额外训练,在 Terminal-Bench V2、SWE-Bench Verified 等四个基准上均达到当前最优。 把“验证”做成可扩展轴:用 logit 期望替代离散评分,并用三轴扩展和低成本排序算法同时提升区分度与实用性。 提出 LLM-as-a-Verifier:通过提取评分 token 的 logit 分布并计算期望,得到连续奖励,而不是离散分数。框架沿三个维度扩展验证:评分粒度、重复评估和标准分解。为在有限预算下从多个候选中选出最优轨迹,提出 Probabilistic Pivot Tournament,通过环状初筛选择 pivot,将比较集中在头部不确定候选上,把比较成本从 O(N²) 降到 O(Nk)。
Agent 系统
查看论文
新文
Thumbnail
arXiv Research source

A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets

收录:Recent 作者:未明确披露
线性注意力以固定循环状态实现 O(1) 内存,却因多键值竞争覆盖早期事实而丢失精确召回。HOLA 在 delta-rule 状态外引入有界精确 KV 缓存,以写幅值作为驱逐分数保留 top-w token,并用解耦 RMSNorm-γ 恢复尖锐检索。340M 模型在 Wikitext 困惑度从 27.32 降至 22.92,优于全注意力 Transformer++,并在 32k RULER 大海捞针任务中保持 0.58 召回率。 利用 delta-rule 内在的写幅值信号作为无参数驱逐策略,使线性注意力模型在保持 O(1) 状态的同时恢复精确召回能力 HOLA(Hippocampal Linear Attention)将记忆读取形式化为半参数化测试时回归:循环状态作为参数化估计器处理线性可压缩结构,有界精确 KV 缓存作为非参数修正存储不应被状态吸收的键值对。缓存写入无需额外学习模块,直接利用 delta-rule 已计算的写幅值 β·∥e∥(写强度与残差范数的乘积)作为驱逐分数,保留对状态改变最大的 top-w 个 token;读取路径采用解耦的 RMSNorm-γ 归一化,将缓存 logit 从接近均匀分布恢复为尖锐的近似 argmax 检索,同时保持状态更新路径的单位范数稳定性。该方法在 Gated DeltaNet(GDN)骨干上实例化,每层仅增加约 12,480 个可学习标量(不足模型参数的 0.004%)。
模型架构
查看论文
新文
Thumbnail
斯坦福大学 Official insight

The Global AI Vibrancy Tool 2025 | Stanford HAI

发布:2026-07-19 18:34:51.316+08 团队:未明确披露
这篇来自Stanford的专题解读主要围绕《The Global AI Vibrancy Tool 2025 | Stanford HAI》展开,适合快速了解这家团队最近在关注什么方向。
强化学习
阅读原文
专题解读
Stanford
Official insight
The Global AI Vibrancy Tool 2025 | Stanford HAI
这篇来自Stanford的专题解读主要围绕《The Global AI Vibrancy Tool 2025 | Stanford HAI》展开,适合快速了解这家团队最近在关注什么方向。
Anthropic Official insight

A global workspace in language models

发布:2026-07-19 18:23:19.03+08 团队:未明确披露
该研究旨在通过可解释性方法探索语言模型 Claude 的内部思维,提出可能存在全局工作空间的信息整合机制,但具体方法与实验结果未在摘要中披露,其核心贡献在于对模型内部表征机制的可解释性尝试。值得关注的是,首次将认知科学中的全局工作空间概念引入 Claude 内部思维的可解释性研究...
可解释性
阅读原文
专题解读
Anthropic
Official insight
A global workspace in language models
该研究旨在通过可解释性方法探索语言模型 Claude 的内部思维,提出可能存在全局工作空间的信息整合机制,但具体方法与实验结果未在摘要中披露,其核心贡献在于对模型内部表征机制的可解释性尝试。值得关注的是,首次将认知科学中的全局工作空间概念引...
OpenAI Official insight

Why teens deserve access to safe AI

发布:2026-07-17 00:00:00+08 团队:OpenAI team
了解OpenAI如何通过适合青少年年龄的保护措施、学习工具、家长控制和专家合作伙伴关系,为青少年提供更安全的ChatGPT。
blog
阅读原文
Blog
OpenAI
Official insight
Why teens deserve access to safe AI
了解OpenAI如何通过适合青少年年龄的保护措施、学习工具、家长控制和专家合作伙伴关系,为青少年提供更安全的ChatGPT。