通义万相登顶权威榜单 全面超越国内外主流开闭源视频生成模型

文章编号:52289 资讯动态 2025-02-01 阿里云百炼通义万相大模型

1月9日消息,阿里云通义万相迎来重磅升级,推出万相2.1视频生成模型,在大幅度复杂运动、物理规律遵循、艺术表现等方面全面提升。根据权威评测榜单VBench的信息显示,新版通义万相登上榜首位置,超越混元、海螺AI、Gen3、Pika等国内外视频生成模型。

通义万相登顶权威榜单,全面超越外主流开闭源生成模型

VBench是视频生成领域的权威评测集,它一共有16个评分维度,从整体一致性、动作流畅度、画面稳定性等方面对模型进行全方位评估。VBench榜单显示,通义万相在运动幅度、多对象生成、空间关系等关键能力上拿下最高分,并以总分84.7%的成绩斩获第一。

精准理解和模拟物理世界是当下视频生成模型的核心难题,现有模型生成的视频在大幅运动、物理复杂场景表现较差,容易生成肢体扭曲、违背物理定律的视频。针对这一难题,通义万相团队采用自研高效的VAE和DiT架构,有效增强时空上下文关系建模能力。

在DiT的设计中,全新通义万相使用时空全注意机制,这一机制让模型能够更准确地模拟现实世界的复杂动态;团队还引入了参数共享机制,不仅提升了模型的性能,还有效降低了训练成本;此外,针对文本的嵌入进行优化,实现更优的文本可控性的同时也减少了计算需求。

在视频VAE方面,通义万相设计了一种创新的视频编解码方案。通过将视频拆分成若干块(Chunk)并缓存中间特征的方式,代替直接对长视频的E2E编解码过程,实现显存的使用与原始视频长度无关,从而能够支持无限长1080P视频的高效编解码,这一关键技术为任意时长视频的训练提供了新的路径。

在全新架构下,通义万相在大幅度的肢体运动和肢体旋转场景的视频生成上表现更稳定,即便是花样滑冰、游泳、跳水等运动视频也能保持肢体协调并符合正常运动轨迹。通义万相在文字视频生成上实现了突破,成为首个支持中文文字生成能力、且同时支持中英文文字特效生成的视频生成模型,可满足广告设计、短视频等领域的创作需求。

例如,用户输入“平拍一位女性花样滑冰运动员在冰场上进行表演的全景。她穿着紫色的滑冰服,脚踩白色的滑冰鞋,正在进行一个旋转动作。她的手臂张开,身体向后倾斜,展现了她的技巧和优雅”,通义万相即可精准理解语义,并生成一段接近专业滑冰运动员的视频。

通义万相登顶权威榜单,全面超越外主流开闭源生成模型

据悉,目前该模型已全面开放,用户可在通义万相官网直接免费使用,个人开发者和企业用户还可在阿里云百炼调用通义万相API,进一步创造更丰富的AI工具和应用。

版权文章,未经授权禁止转载。详情见 转载须知 。

全局中部横幅
冷媒回收加注机

华威汽车检设备有限公司是一家集科研,设计,生产,维修.销售和系统集成为一体的高新技术企业,依靠科技求发展,不断为用户提供满意的高科技产品,充分引进和吸收国外先进技术的基础上,已成功开发出微机控制的的全自动冷媒回收加注机,全自动汽车喷油嘴检清清洗机等系列产品.为客户提供方便.咨询电话.13925118983.

CIOBOK实验室

探索CIO知识体系,整理企业信息化/数字化知识,让知识串联与沉淀,帮助我们更注重于思考与创新,快速走向数字化成功之路!

网络营销推广

济南数玄网络是以招商加盟为主的全行业网络营销推广公司,提供网站建设制作搭建、搜索引擎SEO优化、百度竞价托管、抖音、快手、小红书等全网代运营服务,欢迎点击咨询。

首页

上海薪枫电子科技有限公司是一家专业的广告制作公司。

深圳市联森光电有限公司

深圳联森光电致力于LED电子显示屏,LED大屏幕,大型LED全彩显示屏,LED表贴单元板,室内显示模组以及LED电子广告屏生产,具有LED全彩屏研发生产经验,得到很多朋友的认诃与评价。热线电话:0755-29776529

四川消防设备厂家

四川消防设备批发厂家就找攀枝花市仁和区正立消防器材销售部专门从事四川消防灭火器,四川火灾报警设备,四川避难逃生设备等四川消防器材销售以及四川保安器材,四川交通设施批发.我司一直都秉承客户至上/品质为首的理念,多年来成功为各界伙伴提供了优良的产品和服务,获得广大客户的认可和好评,如果您有合作意向欢迎来电联系我司!

板链提升机

我们为您提供板链提升机的信息介绍,囊括了板链提升机的价格、厂家、图片、品牌等参数。想更多了解板链提升机、提升机、斗式提升机等的相关信息,请联系我们进一步咨询。

贵阳鲜花,贵阳花店,贵阳鲜花预定,贵阳市花店订花

贵阳流苏鲜花10年品牌老店提供优质鲜花。贵阳鲜花新鲜直达订购更省心。贵阳市订花异地订花,覆盖全市,送花到贵阳专人配送安全有保障,贵阳鲜花店订花免费送花上门。

灵题库

前端大厂面试题集

全局底部横幅