返回首页
剑的 AI 实验室 · 中文EN

九大分类 · 06

视频、图片与声音

从剪辑、字幕、配音、数字人到视觉创作,先算清模型和算力账。

怎么使用这里先选你正在做的事,再打开项目档案,看它能解决什么、需要什么条件、实际会花多少钱。

这一类正在用的软件

26 个软件,逐个对应 GitHub 解法。

先点你已经在用的商业软件;右侧明确写出 GitHub 项目属于可替代、降低成本、提高效率还是自动化,不把它们混在一起讲。

NB图片与设计 · 文生图片、图片编辑、多图参考Nano Banana / Gemini 图片查看软件 →
提高效率组合可复用图片工作流GitHub 解法 →
GitHub 解法 · 提高效率ComfyUIComfy-Org/ComfyUI像搭积木一样保存和复用整条生成流程,一套工作流反复产出图片、视频、音频和 3D。

像搭积木一样把模型、提示词、参考图和处理步骤连起来,搭好一次就能反复生成图片、视频、音频和 3D 内容。

组合可复用图片工作流
C视频与数字人 · 短视频剪辑与自动字幕CapCut / 剪映查看软件 →
可替代开源剪辑候选GitHub 解法 →
GitHub 解法 · 可替代OpenCutOpenCut-app/OpenCut把日常剪辑留在开源工作台里,让时间线、素材和导出不再被订阅入口锁住。

以 CapCut 开源替代为目标的时间线视频编辑器,面向裁剪、拼接、素材编排和导出等日常工作。项目仍在快速重写,正式使用前可先核对 classic 版本。

开源剪辑候选
Da视频与数字人 · 剪辑和调色的专业工作流DaVinci Resolve查看软件 →
降低成本本地多轨剪辑工作台GitHub 解法 →
GitHub 解法 · 降低成本Timeline StudioMartinDelophy/ai-video-editor在浏览器里完成多轨剪辑、字幕、配音、AI 修复和离线导出,素材尽量留在本地。

把 CapCut 风格多轨时间线、自动字幕、多语言配音、本地 AI 音乐、画面修复、智能裁切、数字人和离线导出放进浏览器;还提供 Codex、Claude Code、Copilot 与 Gemini 可调用的视频编辑 Skill。

本地多轨剪辑工作台
Gi视频与数字人 · 文生图、图生图、文生视频、图生视频、多图合成Grok Imagine查看软件 →
自动化把模型接进整片生产GitHub 解法 →
GitHub 解法 · 自动化OpenMontagecalesthio/OpenMontage只说想做什么,Agent 就从研究、脚本和素材一路做到字幕、配音、剪辑与成片。

把研究、脚本、素材、配音、字幕、时间线、渲染和质检串成整片视频生产流程;可接商业模型,也有免费素材与本地工具路线。

把模型接进整片生产
V视频与数字人 · 文生视频、图生视频、带声音视频Google Veo查看软件 →
降低成本多关键帧与视频延长GitHub 解法 →
GitHub 解法 · 降低成本LTX-VideoLightricks/LTX-Video用关键帧决定视频怎样发展、向前或向后续写,并让新一代模型同步生成画面与声音。

不只把一张图变成短片:它能用多个关键帧控制过程、向前或向后续写、做视频转视频;新一代 LTX-2 还把画面与声音一起生成。

多关键帧与视频延长
Lu视频与数字人 · 文生视频、图生视频Luma Dream Machine查看软件 →
自动化分镜到整片工作流GitHub 解法 →
GitHub 解法 · 自动化Open-MagivizItusiAI/Open-Magiviz输入一个故事想法,它会沿着剧情、角色、分镜、分段生成和合成一路做成视频。

从一个故事大纲自动生成剧情拆解、角色设计、分镜图和逐场视频,最后合成为完整成片。支持横屏与竖屏,并可连接 Veo、Kling、Seedance、Wan 等视频模型。

分镜到整片工作流
K视频与数字人 · 中文视频生成入口可灵 Kling查看软件 →
提高效率补肖像动画能力GitHub 解法 →
GitHub 解法 · 提高效率LivePortraitKlingAIResearch/LivePortrait一张照片加一段驱动视频就能让肖像自然开口和转头,它是高效肖像动画的代表性开源路线。

用源图片或视频配合驱动视频生成肖像动画,支持人物、猫狗、姿态编辑、区域控制和视频转视频;用户已完成真实安装与成片测试。

补肖像动画能力
11声音与音乐 · 配音和语音资产ElevenLabs查看软件 →
可替代本地配音与声音克隆GitHub 解法 →
GitHub 解法 · 可替代VoiceStudiodebpalash/VoiceStudio在本机完成声音克隆、视频配音、听写和有声书制作,核心流程无需账号、API Key 或订阅。

集成 16 个语音合成引擎和 11 个语音识别引擎,可做零样本声音克隆、视频配音、系统听写、多人故事、有声书、说话人分离和批量生成。声音、项目与输出默认留在本机。

本地配音与声音克隆

第一层 · 市面上通常怎么做

先看你正在为谁付费。

这里只列大众常见的商业工具,目的不是替它们推销,而是先明确它们解决什么工作、如何计费,以及成本从哪里开始增加。

商业软件基线

CapCut Pro

短视频剪辑、字幕、模板、特效和部分 AI 视频能力。

官方价格 / 计费方式
官方美国说明列月付 US$19.99、年付 US$179.99;不同地区、设备与促销会变化。
真正的成本痛点
常用 AI 功能、无水印、高分辨率和素材可能进入订阅档。
CapCut 官方说明
商业软件基线

HeyGen

数字人、口播视频、配音、翻译与视频生成。

官方价格 / 计费方式
Creator:US$29 / 月;免费档每月 3 条、每条最长 1 分钟。计费方式正在向 credits 演进。
真正的成本痛点
分钟数、credits、数字人引擎和 API 使用会让“单月订阅”之外出现额外成本。
HeyGen 官方价格页
价格记录规则价格必须标明页面、币种、地区、日期、月付或年付。页面上的数字只是该次查到的官方基线,不代表所有国家、设备或促销价格。

第二层 · GitHub 从这里介入

用 GitHub 解决成本与效率问题

回到全部项目库 →

针对上一层商业软件的费用、能力缺口或重复流程,这里给出开源替代、增强工具和自动化方案。每个项目都标出许可、运行条件和真实成本,方便判断是否适合你。

降成本待研究

OpenCut-app/OpenCut

OpenCut

一句话看懂

把日常剪辑留在开源工作台里,让时间线、素材和导出不再被订阅入口锁住。

以 CapCut 开源替代为目标的时间线视频编辑器,面向裁剪、拼接、素材编排和导出等日常工作。项目仍在快速重写,正式使用前可先核对 classic 版本。

项目类型
开源应用
运行条件
Web / 桌面路线
真实成本
MIT;软件免费,模型、素材和运行环境成本另计
提能力待研究

meituan-longcat/LongCat-Video

LongCat-Video

一句话看懂

一张图加一段声音,就能让真人、动漫角色或动物自然开口说话。

给一张人物图和一段声音,就能让真人、动漫角色或动物开口说话;同一仓库还支持文生视频、图生视频和长视频续写。

项目类型
开源视频与数字人模型
运行条件
Python / CUDA GPU / Docker
真实成本
MIT;代码与模型开放,本地或云 GPU 成本另计
降成本实测中

lipku/LiveTalking

LiveTalking

一句话看懂

输入文字或声音,就能让数字人实时开口并推到网页、直播间或虚拟摄像头。

实时交互式流媒体数字人引擎:输入文字或音频即可驱动虚拟形象实时口型同步,并可通过 WebRTC、RTMP 或虚拟摄像头输出。

项目类型
开源项目
运行条件
云 GPU 候选
真实成本
开源代码,运行成本待核算
提能力已验证

KlingAIResearch/LivePortrait

LivePortrait

一句话看懂

一张照片加一段驱动视频就能让肖像自然开口和转头,它是高效肖像动画的代表性开源路线。

用源图片或视频配合驱动视频生成肖像动画,支持人物、猫狗、姿态编辑、区域控制和视频转视频;用户已完成真实安装与成片测试。

项目类型
肖像动画模型
运行条件
Windows / Linux / Apple Silicon Mac
真实成本
开源代码与权重;本地算力或云 GPU 成本另计
提能力新发现

debpalash/VoiceStudio

VoiceStudio

一句话看懂

在本机完成声音克隆、视频配音、听写和有声书制作,核心流程无需账号、API Key 或订阅。

集成 16 个语音合成引擎和 11 个语音识别引擎,可做零样本声音克隆、视频配音、系统听写、多人故事、有声书、说话人分离和批量生成。声音、项目与输出默认留在本机。

项目类型
本地语音工作台
运行条件
macOS Apple Silicon / Windows / Linux / Docker
真实成本
AGPL-3.0;核心流程无需账号或订阅,模型、硬件和可选远程服务另计
降成本新发现

QuentinFuxa/WhisperLiveKit

WhisperLiveKit

一句话看懂

把正在说的话实时变成字幕,同时区分说话人、翻译并输出兼容 API。

本地实时语音识别与转写工具,覆盖流式识别、说话人分离、翻译和兼容 API。

项目类型
开源工具
运行条件
待核验
真实成本
待核算
提能力新发现

ItusiAI/Open-Magiviz

Open-Magiviz

一句话看懂

输入一个故事想法,它会沿着剧情、角色、分镜、分段生成和合成一路做成视频。

从一个故事大纲自动生成剧情拆解、角色设计、分镜图和逐场视频,最后合成为完整成片。支持横屏与竖屏,并可连接 Veo、Kling、Seedance、Wan 等视频模型。

项目类型
AI 视频创作平台
运行条件
Web / Next.js / PostgreSQL / 自托管
真实成本
代码开放;所接模型、FAL、存储与支付服务成本另计
提能力新发现

ATH-MaaS/Pixelle-Video

Pixelle-Video

一句话看懂

给一个主题,它就把文案、画面、配音、音乐和合成串成一条自动出片流水线。

从主题出发自动串接文案、素材或视频生成、配音、背景音乐和视频合成的 AI 视频生产流程。

项目类型
开源模型
运行条件
待核验
真实成本
待核算
做自动化实测中

calesthio/OpenMontage

OpenMontage

一句话看懂

只说想做什么,Agent 就从研究、脚本和素材一路做到字幕、配音、剪辑与成片。

把研究、脚本、素材、配音、字幕、时间线、渲染和质检串成整片视频生产流程;可接商业模型,也有免费素材与本地工具路线。

项目类型
Agent 视频生产系统
运行条件
Python / Node.js / FFmpeg / AI 编程 Agent
真实成本
AGPL-3.0;本地流程可低成本运行;接入 FAL、Kling、Seedance、Runway、Grok、GPT Image、ElevenLabs 等会按所选服务扣费
降成本待研究

Comfy-Org/ComfyUI

ComfyUI

一句话看懂

像搭积木一样保存和复用整条生成流程,一套工作流反复产出图片、视频、音频和 3D。

像搭积木一样把模型、提示词、参考图和处理步骤连起来,搭好一次就能反复生成图片、视频、音频和 3D 内容。

项目类型
节点式生成工作流
运行条件
Windows / macOS / Linux / 本地或云端
真实成本
GPL-3.0;软件免费,模型、显卡、云 GPU 和工作流维护另计
降成本待研究

Wan-Video/Wan2.1

Wan2.1

一句话看懂

用同一套开放模型完成文生视频、图生视频、首尾帧控制、视频编辑和声音生成。

开源视频生成模型,README 列出文生视频、图生视频、首尾帧视频、视频编辑、文生图与视频音频等任务。

项目类型
开源视频模型
运行条件
Python / NVIDIA GPU;部分模型可用消费级显卡
真实成本
Apache-2.0;代码和权重路线免费,GPU/云端推理成本另计
降成本待研究

Tencent-Hunyuan/HunyuanVideo-1.5

HunyuanVideo 1.5

一句话看懂

把腾讯混元的视频生成模型、权重和推理代码跑到自己的 GPU 或 ComfyUI 工作流里。

腾讯混元视频生成模型,覆盖文生视频、图生视频、480p/720p、超分辨率,并提供 Diffusers 与 ComfyUI 路线。

项目类型
开源视频模型
运行条件
Linux / Python 3.10+ / NVIDIA GPU;模型卸载时官方最低约 14GB 显存
真实成本
项目采用专用许可;模型、商业使用、算力、存储和云 GPU 成本需逐项核对
降成本待研究

Lightricks/LTX-Video

LTX-Video

一句话看懂

用关键帧决定视频怎样发展、向前或向后续写,并让新一代模型同步生成画面与声音。

不只把一张图变成短片:它能用多个关键帧控制过程、向前或向后续写、做视频转视频;新一代 LTX-2 还把画面与声音一起生成。

项目类型
开源视频模型
运行条件
Python / NVIDIA GPU / ComfyUI / 在线试玩
真实成本
Apache-2.0;模型、显卡、云 GPU 或在线服务成本另计
提能力新发现

MartinDelophy/ai-video-editor

Timeline Studio

一句话看懂

在浏览器里完成多轨剪辑、字幕、配音、AI 修复和离线导出,素材尽量留在本地。

把 CapCut 风格多轨时间线、自动字幕、多语言配音、本地 AI 音乐、画面修复、智能裁切、数字人和离线导出放进浏览器;还提供 Codex、Claude Code、Copilot 与 Gemini 可调用的视频编辑 Skill。

项目类型
本地优先 AI 视频编辑器
运行条件
桌面浏览器 / PWA / WebGPU
真实成本
MIT;编辑器免费,浏览器模型需要本地算力与存储
提能力待研究

invoke-ai/InvokeAI

InvokeAI

一句话看懂

生成、局部重绘、画布和节点流程放到一起,图片创作终于能反复修改而不是只抽卡。

本地 Web 创意引擎,提供统一画布、局部重绘、画笔、节点工作流、素材图库和 API 扩展。

项目类型
生成式图片工作台
运行条件
本地 Web UI / GPU
真实成本
主代码 Apache-2.0;模型许可、显卡、云算力与商业 API 费用另计
降成本待研究

mcmonkeyprojects/SwarmUI

SwarmUI

一句话看懂

简单出图和高级 Comfy 工作流共用一个界面,新手与重度用户都不用换工具。

模块化 AI 图片生成 WebUI,兼顾简化生成页和高级 Comfy 节点流程,支持 Stable Diffusion、Flux 等模型;目前仍处 Beta。

项目类型
图片生成 WebUI
运行条件
Windows / macOS / Linux;本地或云 GPU
真实成本
MIT;模型许可、显卡与云算力另计
降成本待研究

ByteDance-Seed/BAGEL

BAGEL

一句话看懂

同一套模型既能看图、出图又能改图,字节 Seed 的开源多模态路线值得实测。

字节 Seed 团队的统一多模态模型,覆盖视觉理解、文生图、图片编辑和自由视觉操作,并提供 Gradio 界面。

项目类型
统一多模态模型
运行条件
Python / Gradio / CUDA GPU
真实成本
Apache-2.0;完整或量化推理仍需较高显存,算力与存储另计
降成本待研究

lllyasviel/Fooocus

Fooocus

一句话看懂

少调参数也能在本地专注提示词出图,它是最接近 Midjourney 简化体验的开源路线之一。

离线图片生成器,强调少调参数的提示词体验,并支持变体、放大、局部重绘和扩图。

项目类型
本地图片生成器
运行条件
Windows / Linux / Colab;NVIDIA GPU 优先
真实成本
GPL-3.0;模型、显卡和存储另计,项目处于有限维护状态
提能力待研究

Acly/krita-ai-diffusion

Krita AI Diffusion

一句话看懂

在 Krita 里边画边生成、局部重绘,AI 不再和真正的修图流程分家。

把生成式填充、实时绘画、放大、参考图、ControlNet 和分区提示放进 Krita 的绘画与修图流程。

项目类型
Krita 生成式编辑插件
运行条件
Krita 5.2+;Windows / macOS / Linux
真实成本
GPL-3.0;本地 GPU、模型或云生成费用另计
降成本待研究

lllyasviel/stable-diffusion-webui-forge

Stable Diffusion WebUI Forge

一句话看懂

更省显存地管理模型、LoRA 和 ControlNet,本地出图工作台更容易跑起来。

在 Stable Diffusion WebUI 基础上优化资源管理和推理速度,兼容常用模型、LoRA、ControlNet 与扩展。

项目类型
本地图片生成 WebUI
运行条件
Windows 一键包 / Python 自托管
真实成本
AGPL-3.0;模型许可、显卡与云 GPU 另计
降成本待研究

Kwai-Kolors/Kolors

Kolors

一句话看懂

中文和英文文字也能直接进画面,做海报时终于不必默认字一定会崩。

快手团队的中英双语文生图模型,强调复杂语义与中英文文字渲染,并支持 Gradio、ComfyUI、局部重绘和 ControlNet。

项目类型
中英双语图片模型
运行条件
Python / Gradio / ComfyUI / NVIDIA CUDA
真实成本
代码 Apache-2.0;模型权重另有许可,商业使用与算力成本需核对
提能力待研究

Stability-AI/generative-models

Stability Generative Models

一句话看懂

从 Stability AI 官方代码进入 SDXL,模型来源、推理示例和许可边界更清楚。

Stability AI 官方生成模型代码库,提供 SDXL 基础与精修模型的文生图、图生图和 Streamlit 推理示例。

项目类型
官方生成模型代码库
运行条件
Python 3.10 / CUDA / Streamlit
真实成本
代码 MIT;各模型权重许可、算力与存储需分别核对
降成本待研究

KDE/kdenlive

Kdenlive

一句话看懂

专业时间线、转场和音频处理都能留在本地,Kdenlive 是成熟的开源剪辑主力。

KDE 维护的免费开源非线性视频编辑器,适合多轨剪辑、转场以及视频和音频效果处理。

项目类型
开源视频编辑器
运行条件
Windows / macOS / Linux
真实成本
GPL-3.0;本地使用免费,素材、插件、存储与硬件成本另计
降成本待研究

lllyasviel/FramePack

FramePack

一句话看懂

一张图就能逐段生成更长视频,较低显存也多了一条可研究的本地路线。

通过逐段预测和固定长度上下文生成视频,提供桌面界面,适合图片转视频及较长视频实验。

项目类型
本地视频生成工具
运行条件
Windows / Linux / NVIDIA RTX 30、40、50 系;最低 6GB 显存
真实成本
Apache-2.0;模型下载、显卡、电力或云 GPU 成本另计
降成本待研究

zai-org/CogVideo

CogVideo / CogVideoX

一句话看懂

文字、参考图和已有片段都能进入视频流程,Sora 类任务有了可自行部署的候选。

Z.ai 官方视频生成仓库,覆盖文生视频、图生视频和视频续写,并提供推理与微调工具。

项目类型
开源视频生成模型
运行条件
Python / NVIDIA GPU / Colab
真实成本
代码与不同权重许可不完全相同;算力、存储与商业条件需逐项核对
降成本待研究

ace-step/ACE-Step-1.5

ACE-Step 1.5

一句话看懂

从一句描述到完整歌曲,还能翻唱、重绘和拆音轨,音乐生成可以留在本机。

支持文本生成音乐、多语言歌词、参考音频、翻唱、局部重绘、音轨分离和时长控制。

项目类型
开源音乐生成模型
运行条件
Windows / macOS / Linux;CUDA、Apple Silicon、ROCm、Intel XPU 或 CPU
真实成本
MIT;硬件、云算力和电力成本另计,生成内容仍需核对版权风险
降成本待研究

QwenAudio/CosyVoice

CosyVoice

一句话看懂

中文、方言、跨语言克隆和流式输出都在一套模型里,很适合搭自己的语音服务。

支持多语言和中文方言的零样本语音合成、跨语言声音克隆、情绪与语速控制、流式输出及服务端部署。

项目类型
开源语音生成模型
运行条件
Python / Linux / Docker / NVIDIA GPU
真实成本
Apache-2.0;模型和第三方组件许可、显卡与部署成本需逐项核对
降成本待研究

hexgrad/kokoro

Kokoro

一句话看懂

小模型也能做多语言配音,Kokoro 的价值是轻、快、容易接进真实内容流程。

Kokoro-82M 的官方推理库,可通过 pip 安装,用较小模型完成英语、中文、日语等多语言文字转语音。

项目类型
轻量语音生成模型
运行条件
Python 3.10–3.13 / 本地或 Colab
真实成本
Apache-2.0;本地硬件、电力与集成成本另计
降成本待研究

modelscope/ClearerVoice-Studio

ClearerVoice-Studio

一句话看懂

底噪、混响和糊掉的人声先交给它清理,录坏的音频多了一次补救机会。

覆盖语音增强、语音分离、超分辨率和目标说话人提取,并提供预训练模型。

项目类型
开源语音处理工具
运行条件
Python / Linux 优先 / 本地或 GPU
真实成本
Apache-2.0;模型与第三方组件许可、GPU 和部署成本需核对