JarvisX开源JarvisHub:把可编辑画布做成多模态创作Agent的共享项目状态

发布时间:2026/8/7 21:30:01
JarvisX开源JarvisHub:把可编辑画布做成多模态创作Agent的共享项目状态 一句话讲清楚JarvisX 开源了 JarvisHub 把可编辑画布做成人和 Agent 共用的项目台账材料、依赖、版本与反馈都留在画布上长程多模态创作可以按节点规划、生成和局部修改。论文标题JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents论文链接https://arxiv.org/abs/2607.23588Github 链接https://github.com/LYL1015/JarvisHub项目链接https://www.jarvishub.site/做一条短剧、一个官网、一叠课件很少是「一条 prompt 出成品」就结束。创作者会囤参考图、写分镜、并排比候选、改局部、留版本、听反馈。改课件第 3 页配图时通常还要回看它引用了哪张素材、上一版为什么被否掉。这些中间物构成项目还没做完时真正的工作现场。现有工具大多只接住其中一段。文生图擅长一次出图却常把试错和版本丢掉。聊天式 Agent 能连续调用工具但上下文主要是线性对话难表达「这张参考管哪几个镜头」。节点工作流把步骤摊开管道却多半要人手先画好。三者共同缺口很具体项目记录难持续保存局部修改也难对准同一个对象。闭源产品已经能展示从提示词到成品的界面外部开发者通常仍看不到三件事一次局部修改究竟改了哪个中间制品、模型是否有权覆盖已确认版本、失败后从哪个检查点恢复。 JarvisHub 试图把这三件事公开到画布和轨迹里。论文把这套外围运行系统叫作 creative agent 的 harness 保存项目状态、限制 Agent 能做的操作并记录出错后的修复过程。JarvisHub 的做法是把画布本身当成共享项目记录。 prompt 、参考、候选、依赖关系、版本关系、用户反馈都保存成能被定位的卡片和连线。 Agent 每一步先看当前画布再在授权范围内改画布过程留在可检查的记录里而不只藏进私有工具日志。Figure 1 三类常见系统各自覆盖创作的一段却缺少统一、可编辑的长程项目记录 JarvisHub 用画布把资产、依赖、修改与反馈留在同一工作区。画布为什么够格当 Agent 工作区长程创作要同时记住四类事已经有什么材料、它们怎么连、哪些候选被接受或否决、下一步该动哪一块。纯对话塞不下空间布局和版本分叉纯节点图若只是固定管道又缺少「 Agent 可读可写的活项目」。先看一个不带符号的例子。用户说「把参考图换成新的」系统不能只换一张图还要知道哪些镜头和页面依赖它、用户是否已认可旧版、本轮是否允许重新生成。 JarvisHub 把第 轮项目写成五类记录是项目材料关系图 是节点 是有向边边类型覆盖参考引用、版本来源关系、生成依赖、分组、流程续接。 存可编辑内容与制品本身 存来源与运行状态 记用户选择与反馈 记空间布局。分项存的好处是 Agent 既能看见「这张图长什么样」也能看见「它怎么来的、用户对它怎么表态、它在画布上落在哪」。单个节点再拆成稳定 ID 、节点种类、布局、输入字段、输出引用、诊断信息与运行状态。节点种类覆盖文本、视觉、视听以及表示流程开始、结束或分支的节点。有了地址 Agent 就可以点名「修第 3 镜」不必在聊天记录里猜被否决的候选也能以后当负例或再编辑入口依赖边让人和模型都能追「这份成片吃了哪些参考」。论文用一张表概括 harness 要撑住的五件事不会随对话结束而丢失的项目记录、受控画布动作、工具与媒体执行、反馈驱动的修改、可追踪与恢复。Table 1 JarvisHub harness 的核心能力状态留在画布上动作经校验过程可回放。三层结构状态、协议、运行时总览如图。每一轮大致是运行时观察画布与用户请求中间层按「当前可用功能」和「本轮允许的权限」筛动作再调用工具或 skill 把结果写回画布。轨迹、评估信号、人工改动与检查点一并留下供反馈、恢复和后续分析。文中把这层中间检查叫作协议桥。Figure 2 画布状态层、协议桥、 Agent 运行时外加轨迹与反馈回路。可以把它理解成一次「改第 3 镜」的受控操作。能力清单 像系统当前「会做什么」的菜单本轮授权 像这一次「准做什么」的权限单。前者可以列出所有可用工具后者只放本轮获准读取、生成或替换的对象。工具返回的观察是 用户或评估器反馈是 随后的修复或后续决策是 。画布按协议实现的状态转移更新这样改画布不再是语言模型里的隐含副作用改了什么、依据哪次观察、反馈如何介入都应进轨迹。运行时负责在授权集合里选动作这是一套执行规则被接受的动作必须贴着当前画布、出现在能力清单里、落在本轮授权内并经协议桥提交。项目当前唯一可信的记录仍在共享画布上运行时不另藏一份私有状态。工具按族分组便于按轮授予与回收Table 2 画布工具、生成工具、原生执行、恢复工具以及同一套清单与授权规则下的 MCP 扩展。画布工具读写节点与边生成工具产出图、视频、音频等原生工具接浏览器、文件、代码、检索、文档与演示文稿等并要求返回可检查制品恢复工具做结构化反馈、校验、检查点与局部修复 MCP Model Context Protocol 工具把外部服务收进同一套调用和权限规则。在工具之上还有三种帮助长任务协同的机制。 Skills 可复用流程脚本编码分镜、按参考生成、设计到网页、视频提示、做课件等步骤避免把每一步写死进协议。 Memory 跨轮记忆保存偏好与既有决定。 Subagents 子 Agent 把可以独立尝试的子任务交给多个 Agent 同时处理由父 Agent 挑选有用结果并合回画布。Figure 3 从用户请求到协议校验后的画布更新人可在同一画布上检查、反馈并接管下一轮。反馈与轨迹成品之外还要留过程创作常常在终稿之前就要改方向。反馈要决定下一跳从已接受节点继续、对失败节点做局部修复、向用户澄清还是证据不足时停下。整条轨迹定义为每一项对应请求、执行前画布、能力清单、授权、动作、工具观察、反馈、修复决策与更新后画布。最终结果看起来不错也不代表中间过程没有丢参考、误删版本或忽略反馈。轨迹把这些过程错误明确记下来也为以后的过程指标与训练数据留下结构。三类长程任务上的定性演示实验在同一 JarvisHub 环境跑。主 Agent 后端为 GPT-5.5 图像用 GPT Image 2 视频用 Seedance 2.0 多模态评估用 Gemini 3.1 Pro 细则在开源仓库。论文明确这是代表性工作流上的定性演示尚未做成完整榜单也没有给出与聊天式 Agent 或人工节点流的定量对比。截图能证明「状态能不能留住」不能直接证明「比替代方案更稳」。Table 3 叙事媒体、交互网页、演示文稿都需要规划、参考组织、中间制品与局部返工。每个任务给两张图画布工作区轨迹以及最终交付物。前者看参考、版本和修改记录是否被完整保留后者只作成品是否说得通的直观检查。叙事媒体把短剧 brief 推成视觉序列。任务示例是生成「牛仔机器人僵尸拾荒者」短剧。工作区上能看到 brief 、规划笔记、视觉参考、分镜候选、依赖边与进度。从展示图看关键帧保留了相近的角色、场景和动作线索但这只是单个工作流的定性案例主要证明画布能保存这些中间状态案例灵感来自 Mx-Shell 原作Zombie Sweeper。Figure 4 叙事媒体的画布轨迹计划、参考、镜头候选与依赖留在同一张图上。Figure 5 叙事媒体成片关键画面展示跨镜线索不作系统间优劣结论。交互网页把美学与交互 brief 落成摄影个人站偏轻、偏动效的方向。画布跟踪设计参考、布局草稿、实现制品、预览与返工状态。成品页在字体、图片落位与版式方向上看起来对齐它说明 brief 、实现与预览可以落在同一张图上继续改而不是证明网页生成质量已经超过某类基线。Figure 6 网页开发过程中的画布状态 brief 、参考、实现与预览可检查。Figure 7 网站成品截图用于展示跨页视觉方向是否说得通。演示文稿把机器学习决策树讲义收成讲课风格的幻灯片。画布记录内容规划、生成图示、幻灯草稿、依赖、 PowerPoint 预览与进度。成片在版式、图示风格与强调色上看起来统一若用户要求「第 4 页改成更适合课堂讲解」后续修改入口应是该页节点及其依赖而不是整份稿从零重做。论文展示了这条链路的可见性尚未报告这类局部改动相对基线省了多少时间。Figure 8 做课件时的画布内容、图示、幻灯草稿与预览同屏。Figure 9 课件成品页用于检查版式与强调色是否跨页统一。三个案例的共同点不是成品类型而是都要反复回看中间制品短剧要追镜头参考网页要核对预览与实现课件要回到内容草稿。把这些对象留在同一画布里后续修改才有明确入口。开放 harness 还想支持什么研究讨论部分把画布说成双用途给人看的界面也是 Agent 的外部记忆与动作空间。开放实现还可以支撑三类研究资产。一是以「初始画布 参考 可用工具 约束 反馈事件 检查点」定义的项目状态基准任务设定超出单条 prompt 与标准答案。二是把终稿质量与过程指标合在一起评上下文是否保住、工具是否用得合适、依赖是否正确、反馈是否被遵守、修复是否成功。三是在同意、脱敏、版权过滤与质控之后用这些结构化过程记录训练规划、工具选择、多模态状态跟踪与局部修改能力。边界论文自己划了四条线。实验是定性演示尚未做成排行榜。 JarvisHub 管编排与项目状态成片观感仍取决于外部生成模型与工具。协议桥让动作显式、可恢复不保证每一步创意决策语义正确。原始轨迹有研究价值但必须先过质量过滤与合规才能当数据用。仓库按 Apache-2.0 开源可用./run.sh或 Docker Compose 拉起 Web 、 API 、 Agents Bridge 与 Trace Viewer 。对研究长程创作 Agent 如何表示上下文、如何在失败后局部修、如何把人的选择写回状态这是一个可运行、可查看、可修改的基础实现。它更适合参考图、候选版本和反馈会不断累积的项目。若任务只有一次生成维护节点、依赖和检查点反而可能增加操作成本。下一步真正要验证的是这些状态记录能否减少返工时间或提高跨轮修改成功率。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

相关新闻