AI Insight Feed
最具技术趋势的信息流,和你一起探索拥有了 AI 的有趣世界 🚀
S
University Hospital Erlangen · FAU Erlangen-Nürnberg · University Heidelberg · ZHAW Zürich
Scientific Reports
Research source
Prediction, syntax and semantic grounding in the brain and large language models
29 名参与者在聆听自然连续语音时接受同步 EEG-MEG 记录:名词在出现前就显示更强的神经准备,出现后还牵动与感觉运动皮层相容的活动;Llama 3.2-3B 同样最容易预测名词,但脑与模型的机制只呈部分平行。
a
Jilin University · King Abdullah University of Science and Technology (KAUST) · University of Alberta · The Swiss AI Lab IDSIA · USI · SUPSI
arXiv
Research source
Self-Improvements in Modern Agentic Systems: A Survey
自主 Agent 正从研究原型走向实际部署,如何在极少甚至没有人类干预的情况下实现可控演化成为关键挑战。本文系统梳理了现代自改进 Agent 的研究脉络,将现有方法归纳为“基础模型改进”与“脚手架改进”两条主线,并建立统一的系统级形式化框架。综述覆盖从经典 AI 到基础模型时代的演进、信号来源与更新目标的分类体系,以及在软件工程、科学发现等领域的应用与评测现状。
a
arXiv
Research source
Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable
AI代理的能力常取决于其harness,但演化时定位分散的行为实现成为瓶颈。Harness Handbook通过静态分析与LLM辅助,自动合成行为中心手册,配合渐进披露工作流,让开发者从行为描述导航到源码,并自动重同步。在Codex和Terminus-2上,手册辅助规划胜率达更高水平(基线28.3%),规划器令牌消耗下降12.7%,跨模块和稀有路径修改收益最大。 首个将行为定位显式化为问题并给出系统解决方案的工作。 提出Harness Handbook,一种通过静态分析提取程序事实、LLM辅助行为组织合成的行为中心表示,将源码映射到执行阶段,形成三级文档树。提出BGPD工作流,从行为描述渐进导航至源码并验证。手册在代码变更后自动重同步。
a
arXiv
Research source
From Memory to Skills: Evidence-Grounded Co-Evolution Governance for Long-Horizon LLM Agents
长周期 LLM agent 常把历史轨迹当被动上下文,难以转化为稳定可复用的能力。本文提出 MSCE 框架,将经验组织为带证据的三级记忆,仅把增益为正且近期稳定的策略结晶为 skill。在 EvoAgentBench 上,MSCE 在 IR、Math、SE、KW 分别提升 4.61、4.00、15.39 和 5.17 个百分点,并展现跨域迁移与持续演化能力。
M
Moonshot AI
Research source
Kimi K3: Open Frontier Intelligence
开源大模型若停滞在 1T 参数级别,与闭源系统的差距将持续拉大。Kimi K3 将预训练规模扩展至 2.8T 总参数与 104B 激活参数,结合 Kimi Delta Attention 等架构创新及多强度强化学习,支持百万 token 上下文。其整体扩展效率较 Kimi K2 提升约 2.5 倍,在长程编码、Agent 与推理等任务上达到开源前沿,模型权重已完全开放。 首个开源 3T 级 MoE 模型,系统公开了百万 token Agent RL 训练基础设施与 2.5× 扩展效率提升的完整技术细节。 Kimi K3 是 2.8T 总参数、104B 激活参数的原生多模态 MoE 模型,支持百万 token 上下文。架构上采用 Kimi Delta Attention(KDA)与 Gated MLA 3:1 交替的混合注意力处理长序列,Attention Residuals 实现跨层选择性信息流,Stable LatentMoE 在 896 个路由专家中每 token 激活 16 个,并引入 SiTU-GLU 激活函数和 Quantile Balancing 路由策略稳定训练。后训练阶段在通用、Agent 和编码领域进行多推理强度强化学习,通过多教师 on-policy 蒸馏整合为统一模型。基础设施包括 MoonEP 专家并行、KDA 上下文并行、可恢复微虚拟机沙盒等。
a
arXiv
Research source
Latent Recurrent Thoughts: Recurrent Refinement of Proposed Latents for Reasoning with Frozen LLMs
链式思维在离散 token 空间易累积错误且依赖推理轨迹数据。本文提出 Latent Recurrent Thoughts(LRT),用任务编码器生成基础隐状态,再由小型循环网络在连续空间迭代修正,全程冻结 LLM 解码器、仅用答案监督。LRT 在 Countdown-4 达 56.7%,显著优于 SoftCoT 等同类方法,推理算力仅为思维模式提示的 1/9 至 1/450,但需按任务族训练、尚无零样本泛化。
a
arXiv
Research source
Agentic Empirical Asset Pricing: Methodological Foundations
当前 LLM agent 因子挖掘系统多仅对输出做静态回测,难以区分真实能力与偶然成功。本文提出智能体实证资产定价(AEAP)范式及 SEADS 系统,引入对发现过程本身的样本外滚动评估。在两个美股面板上评测六个系统发现,单一指标无法一致排序,且现有系统均未实现滚动重执行,暴露评估盲区。
a
中国科学院空天信息创新研究院 · 中国科学院大学 · 目标认知与应用技术重点实验室
arXiv
Research source
RingMoClaw: An Experience-Inspired Multi-Agent Framework for Self-Evolving Research in Remote Sensing
遥感视觉模型改进长期依赖人工试错,现有 agent 多聚焦单次任务而缺乏持续研究闭环。RingMoClaw 构建研究分支、质控分支与双流经验总线的多智能体框架,在目标检测等四项任务上实现自动策略演化,mAP50 提升 1.84%,且比已有自动化框架减少超 40% 演化轮次。值得关注的是,用异构 Critic 与双流经验总线把遥感研究试错变成可复用、可剪枝的自动演化闭环