登录社区云,与社区用户共同成长
邀请您加入社区
首个对比式干预视频世界模型基准:319 对测试样本 + 六原语分类学 + APEO 成对评测,最强模型仅 51.7%、开源均值 27.8%,单视频评测系统性高估因果敏感度。
【arXiv 2026】DreamZero 论文解读:14B 世界行动模型(WAM)零样本泛化 2 倍超越最先进 VLA(AgiBot unseen 39.5% vs 16.3%),10-20 分钟视频跨本体迁移 +42% 相对提升,38× 推理加速实现 7Hz 实时闭环控制。
微分智飞则在飞行具身领域深入探索,将 Seedance 融入飞行机器人应用,打造出一套标准化、高难度的数据集生成流程,能够精准模拟障碍物闪避、室内自主寻路、智能目标锁定乃至复杂镜头运动等真实难题,产出高质量训练数据。增加了视频局部编辑能力,支持在维持整体画面节奏的前提下,对背景、商品、人物等局部元素进行精准修改;此次升级将视频生成从“能生成”推向“可修改、可迭代、可交付”的新阶段,其应用边界也正从
本文介绍了如何利用星图GPU平台,自动化部署EasyAnimateV5-7b-zh-InP/7B参数量图生视频模型,并将其应用于人工智能教学中的算法可视化。通过该模型,教师可将静态算法示意图转化为生动的动态演示视频,例如直观展示排序算法中数据的交换与移动过程,从而有效降低学生的理解门槛,提升教学效果。
本文介绍了如何在星图GPU平台上自动化部署Live Avatar阿里联合高校开源的数字人模型,实现高保真、长时稳定的数字人视频生成。该镜像特别适用于电商直播切片、企业培训视频等需人物形象一致性和视觉表现力的典型场景,显著提升专业级数字人内容生产效率。
本文介绍了如何在星图GPU平台上自动化部署Live Avatar阿里联合高校开源的数字人模型,实现AI视频生成功能。用户可基于单卡80GB或4×24GB GPU配置,快速启动本地数字人视频生成流程,典型应用于企业宣传片制作、课程讲师视频生成等场景,显著提升专业视频内容生产效率。
本文介绍了如何在星图GPU平台上自动化部署TurboDiffusion清华大学等推出的视频生成加速框架文生视频图生视频基于wan2.1wan2.2 二次webui开发构建by科哥镜像,实现秒级文生视频与图生视频生成,典型应用于电商产品展示、教育动态演示及社交媒体内容快速制作,显著提升AI视频创作效率。
本文介绍了如何在星图GPU平台上自动化部署Heygem数字人视频生成系统批量版webui版(二次开发构建by科哥),实现数字人视频的快速制作。该平台简化了部署流程,用户可通过WebUI界面轻松上传音频与视频素材,批量生成口型同步的数字人讲解视频,适用于企业宣传、教育培训等内容创作场景。
本文介绍了如何在星图GPU平台上自动化部署Wan2.2-I2V-A14B私有部署镜像(RTX4090D 24G CUDA12.4优化版),实现高效视频生成功能。该镜像经过优化适配,特别适合Mac M系列芯片用户,可应用于短视频制作、动态内容生成等场景,显著提升创作效率。
本文介绍了如何在星图GPU平台上自动化部署HunyuanVideo-Foley私有部署镜像(RTX4090D 24G CUDA12.4优化版),实现视频与音效的AI生成功能。该镜像支持自定义模型权重热替换,适用于影视后期制作、游戏音效设计等场景,显著提升多媒体内容生产效率。
本文介绍了如何在星图GPU平台上自动化部署TurboDiffusion清华大学等推出的视频生成加速框架文生视频图生视频基于wan2.1wan2.2 二次webui开发构建by科哥镜像,实现高效AI视频生成。用户无需配置环境,开机即用,可快速完成文本生成视频(T2V)或图像生成视频(I2V)任务,适用于短视频创作、电商动效、课程素材制作等典型场景。
本文介绍了如何在星图GPU平台上自动化部署Live Avatar阿里联合高校开源的数字人模型镜像,实现基于文本、图像或音频驱动的数字人视频生成功能。用户可快速搭建应用环境,典型用于虚拟主播、在线教学等场景的高质量数字人视频制作。
PaddleOCR-VL-1.5 是 PaddlePaddle 团队发布的 PaddleOCR 系列的多模态 OCR 模型之一,面向复杂文档场景(票据、合同、论文、扫描件等)提供更强的文字识别与版面理解能力。视频提供了多模态的物理标注,包括 RGB、深度和光流信息,支持多机器人和多任务的多样性,覆盖不同的机器人类型、场景和动作技能。THINGS-EEG 是一个面向物体认知研究的脑电图数据集,记录了
本文提出了一种名为ReWorld的框架,利用分层奖励模型和强化学习,解决了视频生成模型在物理真实性、动作合理性和任务逻辑上与视觉效果脱节的问题。
Astra模型提出了一种通用交互式世界建模新范式,新性地将自回归长时程建模与扩散高保真合成相结合,通过噪声增强历史记忆机制和动作感知适配器,在自动驾驶、机器人操作等多样化场景中实现了高精度未来预测与动作交互。实验表明,Astra在保真度、远距离预测和动作对齐方面显著超越现有世界模型,为构建可交互、高一致性的通用视觉世界模型提供了新思路。
Google DeepMind团队构建了基于Veo视频基础模型的生成式评估系统,用于在名义场景、分布外(OOD)场景及安全测试中评估双臂机器人的Gemini Robotics策略,并通过1600+次真实世界实验,验证该系统能准确预测策略相对性能、OOD下性能退化及安全漏洞。
提出一种名为Real2Edit2Real的框架,通过3D控制界面连接3D可编辑性与2D视觉数据,无需仿真引擎和数字资产,从少量RGB机器人演示中生成多样化、多视图且物理一致的操作演示视频,大幅提升数据效率并解决空间泛化难题。
值得注意的是,它可以生成符合指定轨迹的高质量视频,最高可达204帧,分辨率为720p。从GitHub 上的 README 文件来看,由于阿里目前的商业使用计划,当前开放的是文生视频版本的Tora。未来,阿里团队计划推出 ModelScope 的试用 demo、训练代码以及完整版本的 Tora,以满足更多用户的需求,这无疑将推动文生视频技术的进一步发展。尤其值得注意的是,当文本提示中的对象与预设轨迹
文章链接:https://arxiv.org/pdf/2408.06070git链接:https://github.com/dvlab-research/ControlNeXt项目链接:https://pbihao.github.io/projects/controlnext/index.html提出了ControlNeXt,这是一种强大且高效的图像和视频生成方法,大幅减少了延迟开销和参数量。