9月8日,智象未来(HiDream.ai)研发的内容创作智能体 vivago R1 正式面向全球用户上线,国内版本 「够搭」 同步完成升级发布。这距离 vivago R1 在今年7月世界人工智能大会上的首次公开亮相仅过去不到两个月,彼时,它以“全球首个无限时长内容创作智能体”的标签引发行业广泛讨论,如今,vivago R1以正式产品的姿态,向全球创作者兑现了当初的技术承诺。

时长不是目的,叙事才是
vivago R1 给行业带来的最直接冲击,在于它对“时长”这一维度的重新定义。当前AI视频生成的主流能力,仍停留在Sora所代表的15至30秒片段式生成阶段。而 vivago R1 实现了一次性稳定输出5分钟高质量视频的跨越,并支持无限次多轮延长,将创作单元从“镜头”提升至“段落”乃至“全片”。
但 vivago R1 的产品逻辑不止于时长的简单拉伸,真正的难点在于一部多镜头、多角色、多场景的视频,如何在数分钟的叙事跨度中保持逻辑自洽、角色统一与风格连贯。vivago R1 的解法是通过其 Agent 系统对长任务进行全局规划与动态调度,主 Agent 负责理解并拆解用户的创意意图,多个子 Agent 分别承担脚本撰写、分镜设计、角色塑造、场景构建与音效匹配等细分任务,确保各段落之间的角色形象、场景风格与叙事节奏高度统一。
这一过程依托智象自研的 HD-AgentOS 全流程调度与治理能力,该系统将 vivago R1 的内容有效可用成功率提升至85%,显著降低了AI视频创作中常见的反复“抽卡”现象。与此同时,vivago R1 在跨镜头角色一致性和场景过渡自然度方面做了深度优化,有效改善了AI视频中容易出现的“塑料感”与“瞬移感”,让运镜衔接与音画对齐更接近真实拍摄的质感。
对话优先,隐复杂于简洁背后
在当前的AI视频工具生态中,产品路线逐渐分化。一类是面向高阶用户的画布式、节点式工作流,用户需要自行连接和调试各类模型与参数,灵活性高但门槛不低。vivago R1 则选择了另一条路径,Chat-First(对话优先)。

这一选择基于一个朴素的产品洞察:对话是人类最本能的表达方式,也应当是AI最友好的交互界面。用户无需面对复杂的节点和参数,只需用自然语言描述创作意图,vivago R1 便能自动进入生成流程,并支持在持续对话中根据用户反馈进行迭代调整。
这种“对话即创作”的体验,背后是智象未来“做后”与“做厚”的双重产品原则。“做后”,是将专业创作者的审美判断与行业经验编码进 Agent 的编排能力,形成坚实的中后台支撑,“做厚”,则是构建 SkillHub 能力库,将抽象的AI能力转译为产品广告、角色视频、故事短片、品牌内容等真实创作场景,让用户能够清晰感知工具能做什么、从哪里开始。在完整流程中,用户只需表达目标,Agent 负责拆解和执行,SkillHub 作为翻译层自动匹配并编排所需的 Skill 组合,将用户意图转化为可执行的任务序列。
简言之,vivago R1 的对话式创作并不是把复杂性消灭,而是把复杂性隐藏在简洁背后,它将创作从“灵感闪现”到“进入执行”的路径,缩短到只剩下一句话。
全模态理解,让创作围绕同一项目持续推进
视频创作中另一个长期存在的挑战是一致性问题,同一个角色、同一种声音,如何在数十个镜头、多次生成与转换中始终保持一致。智象未来的技术路径,是以基础模型与智能体系统双轮驱动,共同支撑复杂视频创作。

在基础模型层面,智象未来自研的原生全模态世界模型,为 vivago R1 提供了多模态理解与生成的底层能力。它能够将文本、图片、视频、参考资产、文档说明以及历史创作结果纳入同一任务语境,使 Agent 能够理解“任务全貌”,而非孤立的单点指令。用户可以“说不清的直接给”素材,vivago R1 会在统一的上下文中进行理解、组织与执行。
在智能体系统层面,Agent 负责将模型能力组织为可持续推进的创作流程,在脚本、分镜、角色、场景、镜头与音效之间进行规划与调度,确保复杂叙事中的角色形象、声音特征与风格保持一致。配合新推出的资产库功能,用户在创作过程中生成并认可的内容可以被系统性地沉淀与复用。一次创作不再是一次性的输出,而会成为下一次创作的基础素材。
基础模型决定了能力上限,智能体系统则负责将能力转化为稳定、可控、可复用的作品交付。两者的协同,让AI创作从“一次次孤立生成”走向“围绕同一项目持续推进”。
创作者用作品说话:从《西游记》到商业广告
在 vivago R1「够搭」沉浸式工作坊活动现场,来自全球的创作者们通过线上线下的方式,分享了他们的使用体验与创作成果。

近期引发热议的AI版《西游记》,成为现场创作的一个经典样本。一位创作者使用 vivago R1 尝试了这一题材的再创作,生成了近5分钟的西游题材作品。从角色造型到场景氛围,再到东方奇幻质感的呈现,vivago R1 对经典文本的视觉转译能力得到了直观验证。

在真人质感方面,vivago R1 同样表现出色。现场展示的一支励志短片,讲述了体育老师周岚从迟疑到重新出发的故事。画面中奔跑时的肌肉震颤、汗水光泽,以及脚步压过塑胶跑道的颗粒质感均被细腻还原,让角色的情绪变化更具真实感染力。创作者提交提示词后,vivago R1 自动理解人物关系、情绪转折与动作节奏,生成对应角色、场景与关键画面,创作者仅需通过对话补充想法即可推进内容生成。


在商业广告场景中,vivago R1 也展现出较强的适配能力。一则红色折叠手机广告案例中,vivago R1 根据提示词理解产品、人物与场景关系,生成了手机多视图、女设计师造型、工作室与户外生活场景,以及包袋、色卡、草图等视觉资产,完整呈现了从创作、出行到回归设计的日常灵感流动。

多位海外创作者也通过线上连线分享了使用体验。一位创作者表示:“视频创作的终点,就是一次表达。”这正是许多 vivago R1 用户的共同感受,当复杂流程被隐藏在对话之后,创作者可以更专注于表达本身。
CHATS™:为视频 Agent 建立可衡量的交付标准
当AI视频产品真正进入专业创作场景,行业需要的便不再是零散的能力清单,而是一套可衡量、可依赖的交付标准。基于 vivago R1 在真实创作场景中的实践验证,智象未来提炼出一套面向视频 Agent 的评估框架CHATS™,用以衡量一个视频 Agent 是否具备真正的作品交付能力,其中C(Consistency)指的是一致性,让角色、场景、风格在多镜头中保持稳定;H(Human Intent)指意图理解,准确理解用户创意,并能在多轮对话中持续推进;A(Audio & Visual)表示视听完整度,不仅生成画面,也能组织声音、节奏与整体视听体验;T(Timeline & Tale)代表时间线与叙事,让故事在多个镜头与段落中持续成立;S(Stability)则是稳定交付,降低反复生成与返工成本,提高内容可用率。

这五个维度经过vivago R1在大量真实创作场景中的反复验证,智象未来希望通过构建这一用户视角的评估标准,来推动AI Agent行业朝着更好的方向发展。
创作终将继续,对话永不停歇
回顾以往,2024年5月vivago.ai 上线,成为全球最早一批公开可用的AI视频生成产品;2025年5月,vivago.ai 登顶 Product Hunt 日榜第一。如今,vivago.ai全球用户突破7000万,短短两年时间,智象未来高效完成了从“可用”到“单反级交付”的跨越式进阶。
据了解,vivago R1 中的“R”承载着双重含义:一是 Reasoning(推理),用深度推理将灵感转化为作品;另一方面也代指Rock(摇滚),向无惧挑战的创作精神致敬。可以这样说,只要对话还在继续,那么一幕幕精彩的故事就永远不会停下脚步。
