9月15日,合肥人工智能企业智象未来正式发布首个原生全模态视频生成模型HiDream-O1-Video-1.0,模型简称HD-V1。这款模型支持文本、图片、视频等多种模态输入,可一键直出5至20秒1080p高保真视频,发布同期在两项国际第三方评测中进入全球前列:在Artificial Analysis含音频的图生视频榜单中位列全球第四,在Arena.ai的图生视频评测中排名第八。
放在今年4月以来的产品线里看,这次发布补齐了关键一环。智象未来此前已基于自研原生全模态架构推出图像生成、交互式世界模型与具身世界模型等产品,HD-V1加入之后,其模型矩阵覆盖图像、视频、3D交互与具身动作四个方向,公司称业内首个原生全模态世界模型闭环就此成形。
HD-V1在能力描述上刻意与单纯画质升级拉开距离。官方强调,相比追求像素提升,模型进一步强化了对用户意图与真实世界物理规律的理解。面对口语化、碎片化的用户指令,它能够对镜头、场景、人物动作、运镜、台词和声音等内容进行自主规划,并根据事件发展逻辑和动作周期,自主决定生成5至20秒中合适的时长,而不是让用户去猜该填几秒。
自主规划能力一旦成为卖点,评测方式也要跟着变。传统视频生成评测看画质与指令遵循,这项能力则要看模型是否在合适的时点收尾,需要按内容类型分别建立评判标准:动作类镜头与对话类镜头的合理时长分布完全不同,同一套时长规则套不到两种场景上。
这类自主规划能力对应的是视频生成最常见的失败模式:用户只说了半句话,模型要么把镜头钉死,要么在几秒内塞进过多情节导致动作崩坏。把时长决策交给模型,前提是它得先判断这段内容本身需要多少时间展开。智象未来CTO姚霆把这一层概括为,视频生成的进一步发展不仅在于像素提升和时长延续,更在于模型能否真正理解创作者的意图和真实世界的物理规律。
物理规律理解是HD-V1着重披露的能力项。官方称模型进一步学习了重力、碰撞、惯性、光影变化、空间连续性等真实世界规律,让生成画面中的物体运动和交互更加自然。这些词在视频生成领域并不新鲜,但能否做到决定了产出是可直接使用的素材还是需要大量返工的半成品,尤其是涉及人物动作与物体接触的镜头。
物理一致性之所以难,在于它无法靠单帧美学指标衡量。常见问题往往出现在动作与动作之间:人物转身时衣料走向不连贯,杯子放下后液面没有随之晃动,球体弹起的轨迹与地面材质不匹配。这些问题单独看每一帧都不算错,连起来看就会产生不真实感,模型必须维持一套跨帧的物理约束。
从技术路线看,智象未来走的是统一表征这条路。姚霆解释,真实世界本身就是全模态的,图像记录状态,视频记录变化,空间提供结构,动作带来交互,语言承载意图和知识,公司的原生全模态架构希望在同一个Transformer里把多种原始信号端到端对齐,实现任意模态输入与任意模态输出。HD-V1正是从架构设计之初就面向文本、视频与音频的统一表征,而不是在视频模型上外挂音频模块。
音画一体化是这次升级的另一条主线。官方表示模型对文本、视频、音频信号进行联合建模,可同步生成画面与声音,使人物口型、环境声、物体碰撞声等与视频内容保持一致。这条能力在榜单上的体现也很直接,HD-V1进入的是含音频的图生视频榜单,这类评测比纯画质对比更接近成片交付的实际需求。
把音频纳入生成链路还有一个连带好处:输出更接近可直接交付的成片。过去用视频模型做广告素材,通常是先生成画面,再单独配音、配乐、对口型,最后在剪辑软件里对齐,中间任何一步对不上都要回到上一步重做。画面与声音在同一套表征里生成,返工点会明显减少,这也是榜单从纯画质对比转向含音频评测的原因。
音画同步难在耦合。分开生成再对齐的做法容易在快节奏镜头里露馅,人物说话的节奏与口型对不上、脚步与地面接触声错位,观众一眼就能看出不自然。把音频纳入统一表征意味着模型在生成画面时就已经知道这一帧该有什么声音,理论上更容易保持一致性,代价是训练与推理的复杂度上升。HD-V1选择把这条路走通,也解释了它为什么把定位放在世界模型体系而不是单一视频工具上。
发布当天,智象未来还宣布完成C+轮融资,本轮投资方为新微资本、交子资本与工银资本。此前公司刚宣布完成15亿元人民币C轮融资,正式跻身独角兽行列,近三个月内已完成三轮融资,累计融资额超过21亿元。这家成立于三年前的科大硅谷培育企业,把资金集中投在底层架构自研上。
投资方的表态点出了逻辑。交子资本方面表示,智象未来推动图像、视频、3D交互与具身四大模型同源演进,HD-V1的发布补齐了模型矩阵的关键一环。同源演进的商业含义是,同一套架构可以同时服务内容创作与机器人训练这类看起来相距很远的场景,模型能力的复利更高。创始人梅涛给出的路线图也是这个意思:构建一套以统一技术架构为底座、面向世界模型持续进化并走向可落地的原生全模态体系。真正需要观察的是这套体系能不能在商业交付上跑出规模,而不只是榜单名次。