← 返回博主原创
BiFish original · 2026-07-25

Wan2.1:阿里出品的 AI 视频生成,8GB 显存就能跑

阿里巴巴开源,普通显卡就能用,中文提示词效果极佳,新手入门 AI 视频的首选

它是什么

Wan2.1(万相 2.1)是阿里巴巴开源的 AI 视频生成工具。跟其他同类工具最大的区别是:它对电脑配置要求特别低,只要 8GB 显存的显卡就能跑。

8GB 显存是什么概念?RTX 3060、RTX 4060 这些两三千块钱的「平民显卡」就够用。不像其他工具动不动就要 24GB 显存、上万元的显卡。

它支持两种玩法:

  • 文字生成视频(Text-to-Video):你写一段描述,AI 生成对应视频
  • 图片生成视频(Image-to-Video):你给一张图片,AI 让图片里的画面动起来

而且它的中文理解能力非常强,用中文写描述的效果甚至比很多工具用英文还好。

解决什么问题

AI 视频生成工具很多,但之前一直有个大问题:门槛太高

  • 显存要求高:大部分工具要 24GB 显存,普通人的游戏本根本跑不动
  • 中文支持差:必须用英文写描述,对英语不好的用户很不友好
  • 安装复杂:依赖一大堆,装半天还报错
  • 效果不稳定:生成十次有八次是废片

Wan2.1 就是来解决这些问题的。阿里把它做成了一个「普通人也能用」的 AI 视频工具:配置要求低、中文效果好、安装相对简单、生成质量稳定。对于想入门 AI 视频生成但又不想花大钱买设备的中文用户来说,这基本是目前最好的选择。

长什么样

Wan2.1 启动后是一个网页操作界面(基于 ComfyUI 或自带的 Gradio 界面),打开浏览器就能看到:

  • 左侧:输入区。一个文本框让你写视频描述,下面有上传图片的按钮(图生视频模式用)
  • 中间:参数面板。可以设置视频时长(通常 2-5 秒)、分辨率(480p/720p)、生成步数等
  • 右侧:输出区。生成好的视频在这里预览和下载
  • 底部:进度条。显示当前生成进度,不用干等着猜还要多久

界面是中文的(或者至少支持中文输入),对国内用户很友好。

怎么安装

硬件要求:NVIDIA 显卡,显存 8GB 以上。RTX 3060 12GB、RTX 4060 8GB、RTX 4070 12GB 都可以。硬盘至少留 30GB 空间放模型文件。

  1. 安装 Python:去 python.org 下载 Python 3.10 或 3.11,安装时一定勾选「Add Python to PATH」这个选项
  2. 安装 Git:去 git-scm.com 下载,一路默认安装
  3. 下载项目代码:打开终端(Windows 按 Win + R 输入 cmd 回车),输入:
    git clone https://github.com/Wan-Video/Wan2.1.git
    cd Wan2.1
  4. 创建虚拟环境
    conda create -n wan python=3.10 -y
    conda activate wan
    (没有 conda 先装 Miniconda,安装时勾选「Add to PATH」)
  5. 安装依赖
    pip install -r requirements.txt
    这一步会下载 PyTorch 等大包,可能需要 10-20 分钟,耐心等待
  6. 下载模型文件:去 HuggingFace(README 里有链接)下载模型权重。8GB 显存选「Wan2.1-T2V-1.3B」版本(较小),放到 checkpoints/ 文件夹
  7. 启动
    python generate.py --task t2v --prompt "一只柴犬在草地上奔跑" --size 832*480

怎么用

文字生成视频

  1. 打开终端,进入 Wan2.1 文件夹
  2. 输入生成命令:
    python generate.py --task t2v --prompt "清晨的西湖,薄雾缭绕,一叶小舟缓缓划过湖面,远处雷峰塔若隐若现,中国风,水墨画质感" --size 1280*720 --frame_num 81
  3. 等待生成(8GB 显存大概需要 5-10 分钟)
  4. 生成的视频保存在 outputs/ 文件夹,用任何播放器打开即可

图片生成视频

  1. 准备一张图片(比如你拍的一张照片),放到 inputs/ 文件夹
  2. 输入命令:
    python generate.py --task i2v --image inputs/my_photo.jpg --prompt "镜头缓慢推进,花瓣随风飘落,光影变化" --size 832*480
  3. AI 会让你的照片「动」起来,生成一段有动态效果的视频

中文描述写作技巧

  • Wan2.1 对中文的理解非常好,直接用中文写就行,不用翻译
  • 描述公式:场景 + 主体动作 + 镜头运动 + 风格/氛围
  • 好的例子:「雨后的古镇青石板路(场景),一个撑油纸伞的姑娘缓步走过(主体动作),镜头从低角度跟随拍摄(镜头运动),电影感,暖色调(风格)」
  • 避免太抽象的描述,比如「自由的感觉」「时间的流逝」,AI 不太好理解

需要 AI 模型吗?

Wan2.1 自己就是 AI 模型,不需要额外连接外部 AI 服务。安装时下载的模型权重文件(checkpoint)就是它的全部「智慧」。

8GB 显存选 1.3B 参数版本(小模型,速度快),12GB 以上显存可以选 14B 参数版本(大模型,效果更好)。

如果你想让 AI 帮你把简短的想法扩展成更丰富的视频描述,或者帮你翻译和优化英文提示词,可以去模型导航挑一个适合你的 AI 助手 →

费用

完全免费,硬件门槛也是同类最低。

  • 软件本身:免费开源,Apache 2.0 协议(商用也免费)
  • 硬件要求:8GB 显存起步(RTX 3060 约 1500 元就能搞定)
  • 云 GPU 方案:如果连 3060 都没有,租个云 GPU 跑,8GB 显存的实例大概 1-2 元/小时
  • 没有任何隐藏费用、没有会员、没有生成次数限制

适合谁

  • AI 视频新手:第一次接触 AI 视频生成,不想一上来就折腾高配置
  • 学生党:预算有限,只有一台普通游戏本
  • 中文用户:英语不好,希望直接用中文写描述
  • 短视频创作者:想给视频加一些 AI 生成的创意片段
  • 电商从业者:想让产品图动起来,做成短视频素材
  • 摄影爱好者:想让自己的照片变成动态视频发朋友圈

项目地址

GitHub 地址:https://github.com/Wan-Video/Wan2.1

目前已有 15k Star。阿里通义万相团队出品,大厂背书,文档和社区支持都不错。项目更新频繁,README 写得很详细,跟着步骤走基本不会踩坑。

本文基于公开来源进行分析,AI 参与资料整理与初稿生成,最终由人工确认选题和发布。涉及产品能力、价格或政策时,请以原始来源的最新信息为准。