
Omni-IO Skills: Harnessing Your Agent Omni-Native作者Yanlin Li, Mingyang Hao, Shengqiong Wu, Hao Fei, Mong-Li Lee, Wynne Hsu核心发表机构论文源码未明确标注或暂未可靠识别论文链接arXiv:2609.31847v1发布于arXiv 预印本cs.CL一、核心贡献 / Core Contributions提出并形式化“Agent Harness 层能力组合”这一互补路线论文不把 Omni 能力的增长绑定到基础模型的重新训练或模态扩展上而是在宿主智能体与异构执行后端之间增加一个即插即用层使现有通用智能体在保留推理与规划核心的前提下变为 omni-native。设计并实现 Omni-IO Skills 系统以 hierarchical Skills、标准化多模态执行接口、依赖感知编排、持久化 Asset Registry 四项机制把分散的多模态模型、专家工具与媒体引擎组织为可选择、可组合、可执行、可追溯的能力。提出 Declare Execution GraphsDEG作为多资产工作流表示DEG 显式表达控制依赖与数据依赖按 Wave 并发调度互不依赖的操作将成功输出注册到 Asset Registry并通过可替换执行后端支持下游复用与跨轮次复用。构建面向应用的能力目录27 个 Skills 覆盖 38 个代表性任务横跨 text、image、audio、video、document、3D、code 七种产物模态以及 understanding、generation、reasoning、retrieval 四个能力族。在两个异质宿主上给出一致的实证验证在 UniM-90 上GPT-5.6 Sol 与 Claude Sonnet 5 的输入支持率分别从 40.00% 与 38.89% 提升到 100%相对 SQCS 分别从 26.99 与 27.82 提升到 74.94 与 77.78Strict Structure Score 达到 100.00 与 99.78且不改变宿主智能体的推理核心。二、研究背景与动机 / Background Motivation通用智能体已经能够进行长程规划、推理和行动但其“生产能力”仍然高度碎片化文本、图像、音频、视频、文档、3D 资产和代码往往由不同工具、模型与流程分别处理。对于真正面向应用的任务例如制作一门在线课程或完成一次产品推广这些产物并不是彼此独立的输出——它们共享事实、风格、时序与生产约束。因此一个 Omni 系统不能只是若干单模态工具的简单拼接而必须接收并产出交错组合的七类模态内容并在整个工作流中保持语义与资产连续性。现有两条主要路线各有明显代价。第一条是扩展基础模型到更多模态通过统一自回归建模或离散—连续混合设计把更多模态纳入共享模型。这条路线确实扩展了模型内部的 Omni 能力但能力增长被绑定到昂贵且周期性的模型更新上随着更多模态进入共享模型表征、目标与保真度要求必须被重新调和往往需要新的数据、编解码器、解码器与对齐阶段。第二条是拼装专家模型与工具智能体可以委派给模态专家而不重训练底层模型但这只解决了“委派”本身遗留了更难的协调问题——过程procedures、依赖dependencies、中间产物intermediate assets与跨轮修订cross-turn revisions应当如何被组织、验证、传递和恢复。论文因此提出一个中心研究问题一个即插即用的 harness 能否在保留宿主智能体推理与规划核心的前提下让现有通用智能体变成 omni-native作者将Omni agent harness定义为智能体推理与异质执行后端之间的一个系统层其目标是把分散的模型、工具和过程转化为selectable、composable、executable、traceable的能力。Omni-IO Skills 正是这一层的具体实现它通过分层 Skills、标准多模态执行接口、依赖感知编排与持久化 Asset Registry把多资产工作流表示为 Declare Execution Graphs并允许底层执行后端可替换。其总体思路如图 1 所示分层技能编排多模态理解与生成而生成的资产被注册以供下游与跨轮复用。论文的关键论证是仅有“模态专家”和“技能封装”两个配料并不自动构成一个 Omni 工作流。一个生产任务还必须额外做到五件事选中正确的能力、表达控制依赖与数据依赖、让中间产物跨工具流动、隔离局部失败、为后续轮次恢复先前输出。这五件事正是 Omni-IO Skills 相对于既有模型协调系统与 Agent Skills 工作要补足的位置。与扩展基础模型路线不同Omni-IO Skills 不改变宿主模型的推理核心、不重训练宿主模型而是把能力组合放在 harness 层使系统能够随模型、工具与应用需求一起演化。三、方法 / Methodology3.1 总体框架 / Overall ArchitectureOmni-IO Skills 位于宿主智能体与外部多模态工具之间采用四层架构把任务知识、工具接口、服务实现与持久输出分离。第一层是Skill Entry向宿主智能体暴露统一任务接口把可复用过程知识组织为 Atomic、Expert、Scenario 三级技能并根据用户请求选择相关 Skill、展开为可执行任务规格。第二层是MCP Tool Service为多模态理解、生成与效用操作提供标准化接口把可执行任务规格映射到对应工具能力。第三层是Provider and Configuration把能力绑定到具体 provider、模型、凭证、默认参数与回退策略。第四层是Asset Registry归一化并记录中间与最终输出使其可脱离物理路径被引用与复用。这一分层使宿主智能体无需把应用工作流耦合到某个 provider 或某个工作区路径。其架构总览如图 2 所示。从运行时看当宿主智能体接收到涉及多模态理解或生成的请求后Skill Entry 层选择相关 Skills 并将其展开为可执行任务这些任务被实例化为 DEG 节点显式表达控制依赖与数据依赖执行前DEG 经过结构验证随后按逐次 Wave 调度。每个外部执行节点经 MCP Tool Service 与 Provider and Configuration 层映射到具体工具与 provider宿主原生执行节点遵循同一调度协议。节点成功后输出写入工作区并注册进 Asset Registry。运行时联合组织两条流控制流从 Skill 选择与 DEG 构建开始经验证与依赖感知调度以每个节点的最终状态结束资产流从用户提供、历史以及新生成的 artifact 开始每个 artifact 被归一化为注册资产其本地路径可被解析并传给下游节点。需要说明的是现有资料没有给出任何损失函数或训练目标该工作的核心是 harness 级能力组合与执行编排而不是训练新的基础模型摘要也明确强调不改变宿主智能体的推理核心。3.2 关键模块 / Key Modules技能层级与声明式表示。Omni-IO Skills 的技能体系按任务粒度与组合范围划分为三级而不是按模态划分。Atomic Skills是最小可执行单元每个封装一个具体的多模态理解、内容生成或工具使用操作单步可完成的请求可由宿主智能体直接调用对应原子技能。Expert Skills面向一个具体最终交付物把多个原子操作组织成完整生产工作流覆盖需求分析、任务规划、资产生成、最终组装、质量检查与局部修订当单次原子调用不足且任务需要专业分解、资产组装与成品检查时选择相应专家技能。Scenario Skills面向具体应用场景从用户请求确定所需交付物并协调相应的 Expert 或 Atomic Skills它规定触发边界、典型输入、交付物选择规则与期望输出但不规定固定的媒体组合或固定执行步骤。若请求欠指定则应用上下文相关惯例若任务边界仍不明确则向用户请求澄清。三级技能共享同一套声明式表示技能s ss写作s ⟨ c s , I s , P s , O s , H s ⟩ s \langle c_s, I_s, P_s, O_s, H_s \rangles⟨cs,Is,Ps,Os,Hs⟩其中c s c_scs表示适用条件I s I_sIs表示必需输入P s P_sPs表示执行过程O s O_sOs表示期望输出H s H_sHs表示与其他技能的关系。输入与输出以语义方式描述 artifact而不绑定到特定 provider过程字段既可记录可直接执行的操作也可记录调用其他 Skill 的工作流。选择与递归展开流程为识别任务上下文与请求交付物若请求落在受支持的应用上下文则激活 Scenario Skill若请求是一件专业交付物则可直接选择 Expert Skill若请求是自包含单步操作则直接调用 Atomic Skill随后递归展开直到各步骤可执行。共享输入与中间结果只表示一次不在多个交付物间重复终端任务成为 DEG 节点其中包括由宿主智能体原生执行的任务。全部 27 个技能为 19 个 Atomic Skills、2 个 Expert Skills 和 6 个 Scenario Skills其层级组织如图 3 所示。MCP Tool Service 与统一调用契约。外部能力被组织为三个功能组understanding tools 消费多模态输入并返回结构化分析generation tools 产出 image、video、audio、document 或 3D 输出utility tools 提供搜索与浏览等操作。此外还有 registry management 工具用于资产登记与查询。每个需外部执行的 DEG 节点都通过一个公共契约提交契约包含 task type、self-contained prompt、optional parameters 与 dependency-resolved asset inputs。服务用 task type 选择工具接口从而不把 provider 特定的 API 细节暴露给 Skill 定义。对于外部调用工具服务把 provider 响应转换为统一结果包含输出类型、本地路径、描述与生效参数再转发给 Asset Registry。需要外部多模态服务的操作经 MCP tools 执行代码、Markdown 生成等不依赖外部生成服务的操作可由宿主智能体直接执行。两条路径遵循同一套 DEG 依赖语义返回的输出都可被归一化为系统资产。因此上层 Skill 可以通过稳定的工具契约组合异构能力即使底层 API 与输出格式各不相同。资料显示图像理解、代码生成、Markdown 生成由宿主智能体原生执行不走外部 MCP生成类工具有输出即在返回前注册而原生执行的 code 与 markdown 任务类型需要显式调用register_asset。Provider and Configuration。这一层把工具能力与当前用于执行它的服务实现分离。对每个可外部执行的任务类型系统维护一份绑定字段包括对应 tool、provider、model、credential reference、default parameters 与 fallback policy。因此 Skill 引用的是语义能力例如“图像生成”或“语音合成”而不直接指定 provider 特定端点MCP Tool Service 在准备具体调用时消费该绑定。该分离支持实现级替换而无需重写 Skill 编码的过程知识可新增、替换或重配置 provider 或模型而 Skill 描述与 DEG 结构保持不变。参数分两层default parameters 为每个工具提供一致基线node-level parameters 允许单个任务特化调用而不改动共享 provider 配置。资料中给出的默认参数包括图像aspect_ratio默认1:1、quality默认standard视频duration_seconds默认10、aspect_ratio默认16:9音效默认时长15音乐默认时长30、instrumental默认true语音默认language为zh-CN、speed为1.0。节点可通过自身params覆盖任意默认值生效值会被记录进资产记录。Asset Registry。注册资产逻辑上表示为a ⟨ asset_id , type , subtype , path , description , params , turn_id , source_asset_id ⟩ a \langle \texttt{asset\_id}, \texttt{type}, \texttt{subtype}, \texttt{path}, \texttt{description}, \texttt{params}, \texttt{turn\_id}, \texttt{source\_asset\_id} \ranglea⟨asset_id,type,subtype,path,description,params,turn_id,source_asset_id⟩其中asset_id全局唯一给上层提供独立于物理文件路径的稳定引用type是宽泛资产类别subtype是该类别下的更细分类description与params保留生成上下文与生效参数turn_id把产物关联到其交互轮次source_asset_id在产物被修订或派生自更早产物时记录来源关系。该表示统一适用于经 MCP 工具产出的 artifact以及宿主智能体原生产出的 artifact。记录以 append-only JSON registry 持久化而不是原地更新从而使同一交付物的多个版本保持可追溯。注册表写入是原子的并用文件锁串行化使并行节点或并行会话不能相互覆盖。通过查找与注册接口该层把资产消费者与具体工作区路径解耦并提供下游与跨轮次复用所需的持久引用。资料中还列出了 registry 管理工具set_turn给当前交互轮次中登记的每个资产打上轮次戳register_asset用于原生产出文件并支持source_asset_idget_asset返回完整记录list_assets返回全部已注册资产按完成时间倒序。依赖感知编排与 Declare Execution Graphs。设 DEG 为G ( V , E ) G(V,E)G(V,E)每个节点v ∈ V v\in Vv∈V是一个可执行任务或一个既有资产来源每条有向边( u , v ) ∈ E (u,v)\in E(u,v)∈E表示v vv依赖u uu。可执行节点表示为v ⟨ id , type , prompt , params , depends_on ⟩ v \langle \texttt{id}, \texttt{type}, \texttt{prompt}, \texttt{params}, \texttt{depends\_on} \ranglev⟨id,type,prompt,params,depends_on⟩其中id为唯一标识type为所需能力prompt为自包含操作描述params用于特化执行depends_on记录上游节点或资产引用。边具有双重语义控制依赖表示下游节点必须等前驱完成数据依赖表示当前驱输出被下游操作消费时成立。宿主智能体从层次化 Skill 展开得到的终端任务构建图共享中间结果只表示一次被每个消费者引用。历史资产用带asset_ref的asset_source节点表示该节点在引用被解析后即视为已完成且不发出任何生成调用。执行前图验证需保证每个依赖引用都能解析到某个节点或已注册资产并且诱导出的图是无环的任一检查失败则视为规划错误并重建该图而不以无效形式提交。Wave 调度与失败处理。前驱全部完成的待定节点构成下一个执行 Wave同一 Wave 内的节点相互独立并发派发无未解析前驱的节点进入最早 Wave其余节点进入其全部直接前驱都已完成的最早后续 Wave。调度依据是声明的依赖而不是模态当图像生成与音频生成互不消费时二者可并发运行而以图像为条件的视频节点必须等待其参考图像。节点失败时其待定后代被取消因为所需输入不可用独立分支上的节点继续执行系统记录每个节点的最终状态并且不回滚已完成节点产出的输出。运行时工具路由与资产传播。对每个可执行节点MCP Tool Service 按节点的 task type 选择工具Provider and Configuration 层随后解析对应的 provider、model、credentials、default parameters 与 fallback policy。调用时生效参数等于 provider 默认值、节点级覆盖以及从前驱输出注入的输入三者合成。依赖注入语义为上游节点完成后系统解析其输出的本地路径并按任务关系传给下游工具调用例如 image-to-video 依赖把图像作为初始视觉条件image-to-3D 依赖把图像作为参考图像。因为输入是从图中注入的下游提示词无需内嵌路径。宿主原生执行的任务绕过 MCP 生成服务但保留同一套输入解析、状态与输出注册契约。节点成功后输出写入工作区并注册进 Asset RegistryMCP 工具输出在结果返回时自动注册宿主原生生成的文件在写入后显式注册。轮内下游节点通过 asset identifier 解析上游输出并消费对应本地文件跨轮次用户可通过asset_ref引用历史资产被引用的记录在新的 DEG 中被物化为一个已完成的 source node从而立即可供其后代使用。修订语义是创建新记录该记录可以保留对来源的引用而不是原地更新已有记录。注册仅当对应输出成功写入后才发生注册表写入原子化并以文件锁串行化每个已完成的注册表条目都能解析到具体 artifact。端到端示例。资料给出一个产品推广请求基于一组产品图片生产 poster、带音效的 promotional video 与 landing web page。S5 Event Material Scenario Skill 展开请求经 Poster DesignE1与 Complex Video ProductionE2落到图像理解、图像生成、视频生成、音效生成、代码生成等 Atomic Skills。DEG 形成四个 WaveWave 0 分析产品参考图Wave 1 并行生成海报素材与生成视频与音效Wave 2 生成宣传视频与海报Wave 3 生成落地页。若用户随后要求落地页换一种展示风格已注册的产品分析与推广资产被物化为已完成的asset_source节点只重新执行 landing-page 任务。图 4 展示了这一运行时工作流选定的 S5 Event Material Scenario Skill 经 Expert Skills 展开为五个 Atomic Skills其依赖形成经过验证的 DEG并决定相继的 Wave每个就绪节点走同一执行循环——tool routing、provider resolution、asset injection、execution——成功输出被注册以供下游与跨轮复用。四、实验 / Experiments4.1 数据集与评估指标 / Datasets Metrics实验在UniM-90上进行。UniM-90 是从 UniM 中选取的固定 90 个实例子集覆盖 text、image、audio、video、document、code、3D 七种模态及其代表性交错组合。子集选择独立于任何被评估智能体的原生模态能力详细选择协议写在附录中但现有资料未给出该协议的具体内容因此本文不展开其构造方式与任务分布。评估对象为两个通用智能体GPT-5.6 Sol 与 Claude Sonnet 5。每个智能体评估两种配置Base Agent运行在默认环境中保留系统自带 Skills 与工具排除任何额外安装的第三方扩展或任务特定定制Agent Omni-IO Skills在同一环境中额外加载 Omni-IO Skills 及其关联 MCP 工具服务其余内置 Skills、工具配置、prompt、执行预算全部不变。由于两个智能体的默认能力可能不同作者明确只关注同一智能体内由 Omni-IO Skills 带来的增益不把跨智能体的分数差解读为模型能力排名。评估采用 UniM Evaluation Suite报告以下指标。输入支持率τ \tauτ表示智能体能够完整接收并处理全部输入模态的实例比例。Semantic–Quality Coupled Score (SQCS)联合评估语义正确性与生成质量。Interleaved Coherence Score (ICS)评估交错多模态响应的整体连贯性。Strict Structure Score (StS)衡量严格输出结构一致性。Lenient Structure Score (LeS)衡量模态级覆盖度。绝对与相对两套口径关系为X r e l τ ⋅ X a b s \mathcal{X}^{\mathrm{rel}} \tau \cdot \mathcal{X}^{\mathrm{abs}}Xrelτ⋅Xabs其中X a b s \mathcal{X}^{\mathrm{abs}}Xabs仅在受支持实例子集上衡量性能X r e l \mathcal{X}^{\mathrm{rel}}Xrel进一步反映在完整测试集上的性能因此对低τ \tauτ的 base agent 惩罚很重。对于输入可处理但所需输出模态无法生成、或目标输出无法完成的实例其失败仍然计入指标计算不剔除。这一计分约定使得 base agent 的低结构分也反映了其无法产出目标模态。4.2 主实验结果 / Main Results主结果表全部指标均为越高越好。GPT-5.6 Sol 在 Base Agent 配置下输入支持率τ \tauτ为 40.00%绝对 SQCS 为 67.49绝对 ICS 为 86.53绝对 StS 为 47.84绝对 LeS 为 72.22相对 SQCS 为 26.99相对 ICS 为 34.61相对 StS 为 19.14相对 LeS 为 28.89。加载 Omni-IO Skills 后τ \tauτ提升到 100%绝对与相对指标因τ 100 % \tau100\%τ100%而相等SQCS 为 74.94ICS 为 93.98StS 为 100.00LeS 为 100.00。Claude Sonnet 5 在 Base Agent 配置下τ \tauτ为 38.89%绝对 SQCS 为 71.53绝对 ICS 为 82.29绝对 StS 为 52.21绝对 LeS 为 68.57相对 SQCS 为 27.82相对 ICS 为 32.00相对 StS 为 20.30相对 LeS 为 26.67。加载 Omni-IO Skills 后τ \tauτ提升到 100%SQCS 为 77.78ICS 为 83.28StS 为 99.78LeS 为 100.00。作者据此给出四条结论。第一输入支持率的跃升说明 harness 有效弥补了 base agent 在异构多模态输入/输出上的缺陷使其覆盖 UniM-90 全部任务。第二相对指标大幅提升SQCS 从 26.99 与 27.82 提升到 74.94 与 77.78ICS 从 34.61 与 32.00 提升到 93.98 与 83.28表明在完整测试集上语义质量与交错连贯性显著改善。第三绝对指标也获得提升SQCS 从 67.49 与 71.53 提升到 74.94 与 77.78说明 Omni-IO Skills 不只是拓宽模态支持还提升了任务输出的语义正确性与生成质量。第四结构指标增益尤为显著GPT-5.6 Sol 在 StS 与 LeS 上均达 100%Claude Sonnet 5 分别达 99.78% 与 100%验证 harness 在多模态工具调用、资产管理、输出结构控制上的有效性。数值差方面相对 SQCS 增量为 74.94−26.9947.95 与 77.78−27.8249.96Claude Sonnet 5 的 StS 未达满分是两模型之间在结构分上的唯一差异点。除定量结果外资料还给出两个端到端定性案例。案例 A 是艺术教程生成调用 S4 Education Sharing 规划教程并协调工作流A2 Video Understanding 从视频中抽取绘画步骤A3 Audio Understanding 恢复讲解内容与流程顺序A6 Image Generation 产出 11 张图的教程。案例 B 是产品推广调用 A1 Image Understanding 从图片中抽取产品属性E1 Poster Design 设计海报E2 Complex Video Production 制作宣传视频A16 Code Generation 搭建落地页。两个智能体都能产出全部所要求的输出并在教程步骤一致性、产品身份一致性、交付物之间一致性上保持稳定体现 harness 在多模态理解、生成与复杂任务编排上的稳定性。其定性案例研究如图 5 所示。4.3 消融实验 / Ablation Study需要指出论文现有资料中没有消融实验章节或表格。源码片段明确说明本片段只有主结果表与两个定性案例不存在组件级消融或“去除某模块”的对照实验其他片段也均未包含消融设置或结论。因此本文无法报告各机制例如 DEG 调度、Asset Registry、Provider and Configuration、MCP Tool Service、三级技能层级的独立贡献也无法判断某一模块被移除后指标会如何变化。作者未提供此类证据不能从现有资料推断消融数值或消融结论。从方法论角度看若要严格验证 Omni-IO Skills 的设计合理但并非论文已报告的消融方向包括去掉 DEG 依赖感知调度、去掉 Asset Registry 的跨轮复用、去掉 Provider 回退与绑定层、将三级技能扁平化为单层工具调用、以及禁用 MCP 工具服务而仅保留宿主原生执行。然而这些都属于可预见的后续实验而不是本文已经给出的结果。当前可视为间接证据的是同一 harness 在两个不同宿主上带来一致提升以及绝对指标与相对指标同时改善但这些观察不能替代组件级消融。五、相关工作 / Related Work在 Omni 基础模型方面早期多模态理解与生成研究大体沿两条分离路径发展。一条是统一自回归建模将异构模态离散化在共同序列上做 next-token prediction为混合与交错内容提供统一接口代表工作包括 Unified-IO 2、AnyGPT、Chameleon。其优点是简化架构并自然支持 interleaving但代价是 modality tokenization、序列长度与感知细节压力。另一条是混合离散—连续设计保留自回归语义推理同时使用连续表示、diffusion 或 flow objectives、模态特定 decoder 来保持媒体保真度代表工作包括 Next-GPT、Transfusion、JanusFlow、Qwen2.5-Omni。其优点是保留更大程度 specialization但必须协调 multiple encoders、adapters、objectives 与 decoders。近期系统还引入 streaming、full-duplex interaction、modality-specific experts 来降低延迟与跨模态干扰代表工作包括 Moshi、Qwen3-Omni、Ming-Omni。作者对这些路线的判断是它们扩展的是模型内部的 Omni 能力其支持模态与输出仍耦合到训练数据、架构与更新周期。Omni-IO Skills 的区别在于把 foundation models、specialist models、media engines 当作可替换执行后端将统一放在 task execution 与 artifact flow 层面使应用能独立于特定模型栈演化。在 Agent Harness 与多模态智能体方面foundation model 提供 reasoning and decision policy而 Agent Harness 提供 sustained execution 的操作基质包括 action loop、tool access、context and state management、execution control、verification 与 recovery。ReAct 建立了 interleaved reasoning-action-observation loop使模型可根据环境反馈修正计划MCP 标准化了应用如何向模型暴露外部工具与资源。这些机制定义了智能体的 action surface但可靠长时程执行还依赖如何携带状态、表示依赖、验证结果与包含失败。多模态智能体使用类似控制循环选择与协调 modality specialists例如 MM-ReAct 连接语言模型与 vision experts近期 Omni agents 通过 master-agent delegation 或 active perception 扩展到图像、音频、视频代表工作包括 AgentOmni、OmniGAIA。这些系统常评估 evidence acquisition、question answering、cross-modal reasoning 与 response integration但当生产工作流创建多个 dependent artifacts 时还需要 intermediate-asset transfer、provenance 与 cross-turn revision。Omni-IO Skills 沿这些维度扩展 harness把通用智能体接到异构多模态后端通过 dependency-aware execution 与 persistent artifact state 支持上述需求。在 Agent Skills 方面技能层在 harness 上增加 procedural knowledge layer。一个 Skill 记录任务何时适用、需要哪些输入、工具应如何调用或组合、应产生什么输出因此能保留 tested workflows、domain conventions、executable code 与 composition patterns而不仅是工具暴露的 atomic operations。相关代表工作包括 SkillsBench、CUA-Skill、MM-Skills。片段指出Skills 已覆盖 general expert tasks、computer use、visual agents而 Omni-agent 研究单独确立了协调 modality experts 的价值但二者交集仍未充分发展尤其是 any-to-any understanding/generation、multi-asset execution 与 persistent artifact state 的结合。Omni-IO Skills 连接这两条线hierarchical Skills 组织多模态 procedures周围 Harness 将其变为 composable、traceable workflows并支持 persistent cross-turn asset reuse。总体而言论文把自身定位为模型内 Omni 扩展与专家工具拼接之外的第三条互补路线在 harness 层完成能力组合不改变宿主智能体推理核心并使 procedures、providers、assets 彼此独立可扩展。六、局限性与展望 / Limitations Future Work论文现有资料没有设立独立的 Limitations 小节结论部分也未列出作者承认的局限性。因此以下只能基于资料中体现的设计约束与实现细节进行谨慎推断并明确区分“论文已说明的约束”与“可合理展望的方向”。第一缺少组件级消融。现有资料没有报告任何消融实验因此无法量化 DEG 调度、Asset Registry、Provider and Configuration、MCP Tool Service 与三级技能体系各自的贡献。主结果虽然显示两个宿主上的一致提升但这是整体系统的效果不能替代对单一机制的归因。未来工作可以设计受控消融逐步移除或替换关键模块并报告输入支持率、SQCS、ICS、StS、LeS 的变化。第二Asset Registry 的 append-only JSON 与文件锁串行化写入。该设计有利于跨轮追溯与版本保留但写入被文件锁串行化可能在高并发节点或大量跨轮资产时成为瓶颈append-only 记录也会带来存储增长与资产垃圾回收问题。资料没有讨论注册表的容量治理、压缩、归档或删除策略这可以成为后续工程优化方向。第三失败处理策略不回滚已完成输出。节点失败时其待定后代被取消独立分支继续执行系统只记录每个节点的最终状态已完成节点的输出不被回滚。这有利于保留已验证的中间资产并隔离局部失败但也可能导致部分完成的工作流需要上层额外判断如何处理孤立资产与不一致交付。规划错误时 DEG 会被重建而非提交无效图这暗示规划侧存在重试成本。未来可研究更细粒度的失败恢复、检查点与人工介入策略。第四Provider 绑定依赖外部服务与凭证。可外部执行的任务类型依赖 Provider and Configuration 中的绑定包括 provider、model、凭证、默认参数与回退策略更换 provider 需修改配置并重启 tool service。资料还说明Omni-IO Skills 不要求完整凭据集无凭据时图像理解、PPT/Word/PDF/Excel 生成、代码与 Markdown 生成、语音合成、网页浏览等仍可用首次多模态请求时宿主可调用check_config报告 ready 与 missing 能力以及免费替代方案。但能力上限仍受可用 provider 与宿主原生能力约束部分配置下无法执行某些生成任务。第五宿主原生执行路径的约束。代码、Markdown 等任务由宿主智能体直接完成绕过 MCP 生成服务但需遵循同一输入解析、状态与输出注册契约原生生成的文件需要显式调用register_asset。这意味着原生路径并非无约束旁路其行为差异、一致性与可追溯性仍需进一步评估。第六评估协议细节与跨智能体比较限制。UniM-90 的构造协议在附录中但现有资料未给出具体内容作者明确只关注同一智能体内由 Omni-IO Skills 带来的增益不把跨智能体分数差解读为模型能力排名。因此当前结果支持“harness 对宿主有增益”的结论但不足以支持关于模型本身优劣的更强主张。未来可扩展更多宿主、更多任务分布与更细粒度指标并公开 UniM-90 选择协议以支持复现。此外资料中附录的 “Shared Specification Schema” 小节只出现标题正文被截断因此无法从现有资料判断技能规范格式的完整字段与扩展规则。可合理展望的工作包括扩展 Skill 库与任务覆盖、增加更多 provider 与回退策略、改进并发调度与资产生命周期管理、引入更严格的跨模态一致性与安全性评估以及将 harness 层能力组合推广到更多生产工作流。但需要强调这些是开放方向不是论文已经报告的结果。七、总结 / ConclusionOmni-IO Skills 提出了一条不同于模型内模态扩展与专家工具简单拼接的路线在 Agent Harness 层完成能力组合使现有通用智能体变为 omni-native同时不改变其推理核心。系统通过分层 Skills 组织多模态过程知识通过标准化多模态执行接口把语义任务映射到异构工具通过依赖感知编排把复杂请求表示为 Declare Execution Graphs通过持久化 Asset Registry 保存和复用中间与最终资产。DEG 以控制依赖与数据依赖调度 Wave同 Wave 内独立操作并发执行成功输出注册后可供下游与跨轮复用底层执行后端可替换。资料显示27 个 Skills 覆盖 38 个代表性任务横跨七种产物模态与 understanding、generation、reasoning、retrieval 四个能力族。在 UniM-90 上加载 Omni-IO Skills 后GPT-5.6 Sol 与 Claude Sonnet 5 的输入支持率分别从 40.00% 与 38.89% 提升到 100%相对 SQCS 分别从 26.99 与 27.82 提升到 74.94 与 77.78增量分别为 47.95 与 49.96Strict Structure Score 达到 100.00 与 99.78Lenient Structure Score 均达到 100.00。同时带 harness 后的绝对 SQCS 为 74.94 与 77.78超过 Base Agents 仅在其较窄可支持子集上测得的 67.49 与 71.53。这些结果支持作者的论断harness-level capability composition 是通向 broad、evolvable Omni systems 的实用路径它使流程、provider 与资产彼此独立可扩展并能在不修改宿主推理核心的前提下跨多轮生产工作流协调异构媒体与可复用输出。现有资料未提供消融实验与独立局限性讨论这也为后续研究留下了明确的验证与扩展空间。原文摘要:General-purpose agents can plan, reason, and act over long horizons, yet their production capabilities remain fragmented across text, images, audio, video, documents, 3D assets, and code. Extending a foundation model to additional modalities ties capability growth to costly model updates, while assembling specialist models and tools leaves unresolved how procedures, dependencies, intermediate assets, and cross-turn revisions should be coordinated. We present Omni-IO Skills, a plug-and-play Agent Harness that makes existing agents omni-native through hierarchical Skills, a standardized multimodal execution interface, dependency-aware orchestration, and a persistent Asset Registry. Multi-asset workflows are represented as Declare Execution Graphs, which schedule independent operations concurrently and register successful outputs for downstream and cross-turn reuse across replaceable execution backends. Its 27 Skills cover 38 representative tasks spanning seven artifact modalities and four capability families: understanding, generation, reasoning, and retrieval. On UniM-90, the harness raises the input-support rates of GPT-5.6 Sol and Claude Sonnet 5 from 40.00% and 38.89% to 100%, while increasing relative Semantic–Quality Coupled Score from 26.99 to 74.94 and from 27.82 to 77.78, respectively; Strict Structure Score reaches 100.00 and 99.78. These results establish harness-level capability composition as a practical route to broad, evolvable Omni systems without changing the host agent’s reasoning core.PDF链接:https://arxiv.org/pdf/2609.31847v1部分平台可能图片显示异常请以我的博客内容为准