论文解决了什么问题
现有评测工具往往只覆盖单一模态,各自绑定不同的推理引擎、prompt 约定和指标实现,导致同一个 omni-modal 模型要在多套环境中分别跑评测,且不同论文或团队报告的“同一 benchmark”分数经常不一致。作者希望回答:能否在不重写 benchmark 的前提下,把现有推理与评测组件组合成一套可复现、跨模态、可对比的统一评测系统。
核心方法
OmniEvaluator 将评测拆成数据迭代、推理、后处理、指标计算四个阶段,用统一中间 schema 连接 N 个推理引擎和 M 个评测框架,使集成成本从 N×M 降到 N+M。每次运行生成包含完整配置的 artifact,结果汇入 dashboard;同时提供联邦模式共享 GPU 推理服务器,并内置一个基于 Qwen3-0.6B 的 CPU 可运行 verifier,对 (question, reference, prediction) 三元组给出语义正确性判断。
方法与已有工作的区别
有原文依据相比 HELM、lm-eval-harness、Evalverse 等文本评测工具,以及 VLMEvalKit、lmms-eval、AudioBench 等单模态或多模态工具,OmniEvaluator 不重写 benchmark,而是通过中间 schema 把多个现有框架与推理引擎组合成统一 omni-modal 流水线,并额外提供可复现 artifact、跨模态 dashboard、CPU verifier 与联邦 GPU 调度。
实验结论
- 在 GQA、POPE、OCRBench 等任务上,同一输出使用不同框架或 prompt 时,原生指标最大差值可达 42.3–88.4 分,而 verifier score 最大差值仅约 1.2–4.4 分。
- OmniEval Verifier 在 1,566 条人工校验样本上达到 85.0% 准确率,高于 GPT-5.4-mini(82.8%)和 Claude-Haiku-4.5(84.3%),低于 GPT-5.5(90.2%)和 Claude-Opus-4.8(90.4%)。
- 联邦评测在相同 GPU 分配下,相对传统单进程评测取得 1.3–2.8× 墙钟加速,图像模态平均加速约 2.53×。
- 系统当前支持 4 个推理后端、4 个评测框架,并接入上千个文本、图像、视频、音频 benchmark,覆盖多篇 omni-modal 技术报告中的大多数 benchmark。
- 同一模型输出在不同评测框架或 prompt 下,原生指标最多波动 88 分,verifier score 波动约 1–4 分。
局限性与证据边界
- OmniEvaluator 封装上游评测框架而非重写,因此上游框架中的 bug 可能传导到最终分数。
- Verifier 仅基于文本三元组给出二值判断,无法评估视觉定位、音频质量或生成质量等超出文本正确性的指标。
- 本文主要覆盖 omni-modal 理解任务,对图像或语音生成等多模态输出的评测与 verifier 扩展尚未实现。
适合谁阅读
Benchmark / 评测评测多模态系统基础设施
可核验的原论文来源和作者
- 作者
- 作者信息暂未从原始元数据中确认
- 来源
- arXiv
- 论文 ID
- 2609.01315