本地 Web 创意引擎,提供统一画布、局部重绘、画笔、节点工作流、素材图库和 API 扩展。
本地生成与局部重绘 →九大分类 · 06
视频、图片与声音
从剪辑、字幕、配音、数字人到视觉创作,先算清模型和算力账。
这一类正在用的软件
26 个软件,逐个对应 GitHub 解法。
先点你已经在用的商业软件;右侧明确写出 GitHub 项目属于可替代、降低成本、提高效率还是自动化,不把它们混在一起讲。
像搭积木一样把模型、提示词、参考图和处理步骤连起来,搭好一次就能反复生成图片、视频、音频和 3D 内容。
组合可复用图片工作流 →模块化 AI 图片生成 WebUI,兼顾简化生成页和高级 Comfy 节点流程,支持 Stable Diffusion、Flux 等模型;目前仍处 Beta。
本地图片生成工作台 →字节 Seed 团队的统一多模态模型,覆盖视觉理解、文生图、图片编辑和自由视觉操作,并提供 Gradio 界面。
开源多模态生成编辑 →离线图片生成器,强调少调参数的提示词体验,并支持变体、放大、局部重绘和扩图。
本地简化出图 →把生成式填充、实时绘画、放大、参考图、ControlNet 和分区提示放进 Krita 的绘画与修图流程。
编辑器内生成式修改 →Stability AI 官方生成模型代码库,提供 SDXL 基础与精修模型的文生图、图生图和 Streamlit 推理示例。
官方模型与推理入口 →以 CapCut 开源替代为目标的时间线视频编辑器,面向裁剪、拼接、素材编排和导出等日常工作。项目仍在快速重写,正式使用前可先核对 classic 版本。
开源剪辑候选 →KDE 维护的免费开源非线性视频编辑器,适合多轨剪辑、转场以及视频和音频效果处理。
成熟多轨剪辑 →把 CapCut 风格多轨时间线、自动字幕、多语言配音、本地 AI 音乐、画面修复、智能裁切、数字人和离线导出放进浏览器;还提供 Codex、Claude Code、Copilot 与 Gemini 可调用的视频编辑 Skill。
本地多轨剪辑工作台 →腾讯混元视频生成模型,覆盖文生视频、图生视频、480p/720p、超分辨率,并提供 Diffusers 与 ComfyUI 路线。
开源文生与图生视频 →开源视频生成模型,README 列出文生视频、图生视频、首尾帧视频、视频编辑、文生图与视频音频等任务。
多任务视频模型路线 →把研究、脚本、素材、配音、字幕、时间线、渲染和质检串成整片视频生产流程;可接商业模型,也有免费素材与本地工具路线。
把模型接进整片生产 →不只把一张图变成短片:它能用多个关键帧控制过程、向前或向后续写、做视频转视频;新一代 LTX-2 还把画面与声音一起生成。
多关键帧与视频延长 →给一张人物图和一段声音,就能让真人、动漫角色或动物开口说话;同一仓库还支持文生视频、图生视频和长视频续写。
本地视频生成候选 →从主题出发自动串接文案、素材或视频生成、配音、背景音乐和视频合成的 AI 视频生产流程。
主题到短片自动合成 →从一个故事大纲自动生成剧情拆解、角色设计、分镜图和逐场视频,最后合成为完整成片。支持横屏与竖屏,并可连接 Veo、Kling、Seedance、Wan 等视频模型。
分镜到整片工作流 →用源图片或视频配合驱动视频生成肖像动画,支持人物、猫狗、姿态编辑、区域控制和视频转视频;用户已完成真实安装与成片测试。
补肖像动画能力 →通过逐段预测和固定长度上下文生成视频,提供桌面界面,适合图片转视频及较长视频实验。
较低显存图片转视频 →实时交互式流媒体数字人引擎:输入文字或音频即可驱动虚拟形象实时口型同步,并可通过 WebRTC、RTMP 或虚拟摄像头输出。
数字人与实时口型 →Z.ai 官方视频生成仓库,覆盖文生视频、图生视频和视频续写,并提供推理与微调工具。
自行部署视频模型 →集成 16 个语音合成引擎和 11 个语音识别引擎,可做零样本声音克隆、视频配音、系统听写、多人故事、有声书、说话人分离和批量生成。声音、项目与输出默认留在本机。
本地配音与声音克隆 →支持文本生成音乐、多语言歌词、参考音频、翻唱、局部重绘、音轨分离和时长控制。
本地歌曲生成与编辑 →支持多语言和中文方言的零样本语音合成、跨语言声音克隆、情绪与语速控制、流式输出及服务端部署。
中文方言与流式语音 →Kokoro-82M 的官方推理库,可通过 pip 安装,用较小模型完成英语、中文、日语等多语言文字转语音。
轻量多语言旁白 →覆盖语音增强、语音分离、超分辨率和目标说话人提取,并提供预训练模型。
降噪、分离与语音增强 →第一层 · 市面上通常怎么做
先看你正在为谁付费。
这里只列大众常见的商业工具,目的不是替它们推销,而是先明确它们解决什么工作、如何计费,以及成本从哪里开始增加。
CapCut Pro
短视频剪辑、字幕、模板、特效和部分 AI 视频能力。
- 官方价格 / 计费方式
- 官方美国说明列月付 US$19.99、年付 US$179.99;不同地区、设备与促销会变化。
- 真正的成本痛点
- 常用 AI 功能、无水印、高分辨率和素材可能进入订阅档。
HeyGen
数字人、口播视频、配音、翻译与视频生成。
- 官方价格 / 计费方式
- Creator:US$29 / 月;免费档每月 3 条、每条最长 1 分钟。计费方式正在向 credits 演进。
- 真正的成本痛点
- 分钟数、credits、数字人引擎和 API 使用会让“单月订阅”之外出现额外成本。
第二层 · GitHub 从这里介入
用 GitHub 解决成本与效率问题
针对上一层商业软件的费用、能力缺口或重复流程,这里给出开源替代、增强工具和自动化方案。每个项目都标出许可、运行条件和真实成本,方便判断是否适合你。
OpenCut-app/OpenCut
OpenCut
一句话看懂把日常剪辑留在开源工作台里,让时间线、素材和导出不再被订阅入口锁住。
以 CapCut 开源替代为目标的时间线视频编辑器,面向裁剪、拼接、素材编排和导出等日常工作。项目仍在快速重写,正式使用前可先核对 classic 版本。
- 项目类型
- 开源应用
- 运行条件
- Web / 桌面路线
- 真实成本
- MIT;软件免费,模型、素材和运行环境成本另计
meituan-longcat/LongCat-Video
LongCat-Video
一句话看懂一张图加一段声音,就能让真人、动漫角色或动物自然开口说话。
给一张人物图和一段声音,就能让真人、动漫角色或动物开口说话;同一仓库还支持文生视频、图生视频和长视频续写。
- 项目类型
- 开源视频与数字人模型
- 运行条件
- Python / CUDA GPU / Docker
- 真实成本
- MIT;代码与模型开放,本地或云 GPU 成本另计
lipku/LiveTalking
LiveTalking
一句话看懂输入文字或声音,就能让数字人实时开口并推到网页、直播间或虚拟摄像头。
实时交互式流媒体数字人引擎:输入文字或音频即可驱动虚拟形象实时口型同步,并可通过 WebRTC、RTMP 或虚拟摄像头输出。
- 项目类型
- 开源项目
- 运行条件
- 云 GPU 候选
- 真实成本
- 开源代码,运行成本待核算
KlingAIResearch/LivePortrait
LivePortrait
一句话看懂一张照片加一段驱动视频就能让肖像自然开口和转头,它是高效肖像动画的代表性开源路线。
用源图片或视频配合驱动视频生成肖像动画,支持人物、猫狗、姿态编辑、区域控制和视频转视频;用户已完成真实安装与成片测试。
- 项目类型
- 肖像动画模型
- 运行条件
- Windows / Linux / Apple Silicon Mac
- 真实成本
- 开源代码与权重;本地算力或云 GPU 成本另计
debpalash/VoiceStudio
VoiceStudio
一句话看懂在本机完成声音克隆、视频配音、听写和有声书制作,核心流程无需账号、API Key 或订阅。
集成 16 个语音合成引擎和 11 个语音识别引擎,可做零样本声音克隆、视频配音、系统听写、多人故事、有声书、说话人分离和批量生成。声音、项目与输出默认留在本机。
- 项目类型
- 本地语音工作台
- 运行条件
- macOS Apple Silicon / Windows / Linux / Docker
- 真实成本
- AGPL-3.0;核心流程无需账号或订阅,模型、硬件和可选远程服务另计
QuentinFuxa/WhisperLiveKit
WhisperLiveKit
一句话看懂把正在说的话实时变成字幕,同时区分说话人、翻译并输出兼容 API。
本地实时语音识别与转写工具,覆盖流式识别、说话人分离、翻译和兼容 API。
- 项目类型
- 开源工具
- 运行条件
- 待核验
- 真实成本
- 待核算
ItusiAI/Open-Magiviz
Open-Magiviz
一句话看懂输入一个故事想法,它会沿着剧情、角色、分镜、分段生成和合成一路做成视频。
从一个故事大纲自动生成剧情拆解、角色设计、分镜图和逐场视频,最后合成为完整成片。支持横屏与竖屏,并可连接 Veo、Kling、Seedance、Wan 等视频模型。
- 项目类型
- AI 视频创作平台
- 运行条件
- Web / Next.js / PostgreSQL / 自托管
- 真实成本
- 代码开放;所接模型、FAL、存储与支付服务成本另计
ATH-MaaS/Pixelle-Video
Pixelle-Video
一句话看懂给一个主题,它就把文案、画面、配音、音乐和合成串成一条自动出片流水线。
从主题出发自动串接文案、素材或视频生成、配音、背景音乐和视频合成的 AI 视频生产流程。
- 项目类型
- 开源模型
- 运行条件
- 待核验
- 真实成本
- 待核算
calesthio/OpenMontage
OpenMontage
一句话看懂只说想做什么,Agent 就从研究、脚本和素材一路做到字幕、配音、剪辑与成片。
把研究、脚本、素材、配音、字幕、时间线、渲染和质检串成整片视频生产流程;可接商业模型,也有免费素材与本地工具路线。
- 项目类型
- Agent 视频生产系统
- 运行条件
- Python / Node.js / FFmpeg / AI 编程 Agent
- 真实成本
- AGPL-3.0;本地流程可低成本运行;接入 FAL、Kling、Seedance、Runway、Grok、GPT Image、ElevenLabs 等会按所选服务扣费
Comfy-Org/ComfyUI
ComfyUI
一句话看懂像搭积木一样保存和复用整条生成流程,一套工作流反复产出图片、视频、音频和 3D。
像搭积木一样把模型、提示词、参考图和处理步骤连起来,搭好一次就能反复生成图片、视频、音频和 3D 内容。
- 项目类型
- 节点式生成工作流
- 运行条件
- Windows / macOS / Linux / 本地或云端
- 真实成本
- GPL-3.0;软件免费,模型、显卡、云 GPU 和工作流维护另计
Wan-Video/Wan2.1
Wan2.1
一句话看懂用同一套开放模型完成文生视频、图生视频、首尾帧控制、视频编辑和声音生成。
开源视频生成模型,README 列出文生视频、图生视频、首尾帧视频、视频编辑、文生图与视频音频等任务。
- 项目类型
- 开源视频模型
- 运行条件
- Python / NVIDIA GPU;部分模型可用消费级显卡
- 真实成本
- Apache-2.0;代码和权重路线免费,GPU/云端推理成本另计
Tencent-Hunyuan/HunyuanVideo-1.5
HunyuanVideo 1.5
一句话看懂把腾讯混元的视频生成模型、权重和推理代码跑到自己的 GPU 或 ComfyUI 工作流里。
腾讯混元视频生成模型,覆盖文生视频、图生视频、480p/720p、超分辨率,并提供 Diffusers 与 ComfyUI 路线。
- 项目类型
- 开源视频模型
- 运行条件
- Linux / Python 3.10+ / NVIDIA GPU;模型卸载时官方最低约 14GB 显存
- 真实成本
- 项目采用专用许可;模型、商业使用、算力、存储和云 GPU 成本需逐项核对
Lightricks/LTX-Video
LTX-Video
一句话看懂用关键帧决定视频怎样发展、向前或向后续写,并让新一代模型同步生成画面与声音。
不只把一张图变成短片:它能用多个关键帧控制过程、向前或向后续写、做视频转视频;新一代 LTX-2 还把画面与声音一起生成。
- 项目类型
- 开源视频模型
- 运行条件
- Python / NVIDIA GPU / ComfyUI / 在线试玩
- 真实成本
- Apache-2.0;模型、显卡、云 GPU 或在线服务成本另计
MartinDelophy/ai-video-editor
Timeline Studio
一句话看懂在浏览器里完成多轨剪辑、字幕、配音、AI 修复和离线导出,素材尽量留在本地。
把 CapCut 风格多轨时间线、自动字幕、多语言配音、本地 AI 音乐、画面修复、智能裁切、数字人和离线导出放进浏览器;还提供 Codex、Claude Code、Copilot 与 Gemini 可调用的视频编辑 Skill。
- 项目类型
- 本地优先 AI 视频编辑器
- 运行条件
- 桌面浏览器 / PWA / WebGPU
- 真实成本
- MIT;编辑器免费,浏览器模型需要本地算力与存储
invoke-ai/InvokeAI
InvokeAI
一句话看懂生成、局部重绘、画布和节点流程放到一起,图片创作终于能反复修改而不是只抽卡。
本地 Web 创意引擎,提供统一画布、局部重绘、画笔、节点工作流、素材图库和 API 扩展。
- 项目类型
- 生成式图片工作台
- 运行条件
- 本地 Web UI / GPU
- 真实成本
- 主代码 Apache-2.0;模型许可、显卡、云算力与商业 API 费用另计
mcmonkeyprojects/SwarmUI
SwarmUI
一句话看懂简单出图和高级 Comfy 工作流共用一个界面,新手与重度用户都不用换工具。
模块化 AI 图片生成 WebUI,兼顾简化生成页和高级 Comfy 节点流程,支持 Stable Diffusion、Flux 等模型;目前仍处 Beta。
- 项目类型
- 图片生成 WebUI
- 运行条件
- Windows / macOS / Linux;本地或云 GPU
- 真实成本
- MIT;模型许可、显卡与云算力另计
ByteDance-Seed/BAGEL
BAGEL
一句话看懂同一套模型既能看图、出图又能改图,字节 Seed 的开源多模态路线值得实测。
字节 Seed 团队的统一多模态模型,覆盖视觉理解、文生图、图片编辑和自由视觉操作,并提供 Gradio 界面。
- 项目类型
- 统一多模态模型
- 运行条件
- Python / Gradio / CUDA GPU
- 真实成本
- Apache-2.0;完整或量化推理仍需较高显存,算力与存储另计
lllyasviel/Fooocus
Fooocus
一句话看懂少调参数也能在本地专注提示词出图,它是最接近 Midjourney 简化体验的开源路线之一。
离线图片生成器,强调少调参数的提示词体验,并支持变体、放大、局部重绘和扩图。
- 项目类型
- 本地图片生成器
- 运行条件
- Windows / Linux / Colab;NVIDIA GPU 优先
- 真实成本
- GPL-3.0;模型、显卡和存储另计,项目处于有限维护状态
Acly/krita-ai-diffusion
Krita AI Diffusion
一句话看懂在 Krita 里边画边生成、局部重绘,AI 不再和真正的修图流程分家。
把生成式填充、实时绘画、放大、参考图、ControlNet 和分区提示放进 Krita 的绘画与修图流程。
- 项目类型
- Krita 生成式编辑插件
- 运行条件
- Krita 5.2+;Windows / macOS / Linux
- 真实成本
- GPL-3.0;本地 GPU、模型或云生成费用另计
lllyasviel/stable-diffusion-webui-forge
Stable Diffusion WebUI Forge
一句话看懂更省显存地管理模型、LoRA 和 ControlNet,本地出图工作台更容易跑起来。
在 Stable Diffusion WebUI 基础上优化资源管理和推理速度,兼容常用模型、LoRA、ControlNet 与扩展。
- 项目类型
- 本地图片生成 WebUI
- 运行条件
- Windows 一键包 / Python 自托管
- 真实成本
- AGPL-3.0;模型许可、显卡与云 GPU 另计
Kwai-Kolors/Kolors
Kolors
一句话看懂中文和英文文字也能直接进画面,做海报时终于不必默认字一定会崩。
快手团队的中英双语文生图模型,强调复杂语义与中英文文字渲染,并支持 Gradio、ComfyUI、局部重绘和 ControlNet。
- 项目类型
- 中英双语图片模型
- 运行条件
- Python / Gradio / ComfyUI / NVIDIA CUDA
- 真实成本
- 代码 Apache-2.0;模型权重另有许可,商业使用与算力成本需核对
Stability-AI/generative-models
Stability Generative Models
一句话看懂从 Stability AI 官方代码进入 SDXL,模型来源、推理示例和许可边界更清楚。
Stability AI 官方生成模型代码库,提供 SDXL 基础与精修模型的文生图、图生图和 Streamlit 推理示例。
- 项目类型
- 官方生成模型代码库
- 运行条件
- Python 3.10 / CUDA / Streamlit
- 真实成本
- 代码 MIT;各模型权重许可、算力与存储需分别核对
KDE/kdenlive
Kdenlive
一句话看懂专业时间线、转场和音频处理都能留在本地,Kdenlive 是成熟的开源剪辑主力。
KDE 维护的免费开源非线性视频编辑器,适合多轨剪辑、转场以及视频和音频效果处理。
- 项目类型
- 开源视频编辑器
- 运行条件
- Windows / macOS / Linux
- 真实成本
- GPL-3.0;本地使用免费,素材、插件、存储与硬件成本另计
lllyasviel/FramePack
FramePack
一句话看懂一张图就能逐段生成更长视频,较低显存也多了一条可研究的本地路线。
通过逐段预测和固定长度上下文生成视频,提供桌面界面,适合图片转视频及较长视频实验。
- 项目类型
- 本地视频生成工具
- 运行条件
- Windows / Linux / NVIDIA RTX 30、40、50 系;最低 6GB 显存
- 真实成本
- Apache-2.0;模型下载、显卡、电力或云 GPU 成本另计
zai-org/CogVideo
CogVideo / CogVideoX
一句话看懂文字、参考图和已有片段都能进入视频流程,Sora 类任务有了可自行部署的候选。
Z.ai 官方视频生成仓库,覆盖文生视频、图生视频和视频续写,并提供推理与微调工具。
- 项目类型
- 开源视频生成模型
- 运行条件
- Python / NVIDIA GPU / Colab
- 真实成本
- 代码与不同权重许可不完全相同;算力、存储与商业条件需逐项核对
ace-step/ACE-Step-1.5
ACE-Step 1.5
一句话看懂从一句描述到完整歌曲,还能翻唱、重绘和拆音轨,音乐生成可以留在本机。
支持文本生成音乐、多语言歌词、参考音频、翻唱、局部重绘、音轨分离和时长控制。
- 项目类型
- 开源音乐生成模型
- 运行条件
- Windows / macOS / Linux;CUDA、Apple Silicon、ROCm、Intel XPU 或 CPU
- 真实成本
- MIT;硬件、云算力和电力成本另计,生成内容仍需核对版权风险
QwenAudio/CosyVoice
CosyVoice
一句话看懂中文、方言、跨语言克隆和流式输出都在一套模型里,很适合搭自己的语音服务。
支持多语言和中文方言的零样本语音合成、跨语言声音克隆、情绪与语速控制、流式输出及服务端部署。
- 项目类型
- 开源语音生成模型
- 运行条件
- Python / Linux / Docker / NVIDIA GPU
- 真实成本
- Apache-2.0;模型和第三方组件许可、显卡与部署成本需逐项核对
hexgrad/kokoro
Kokoro
一句话看懂小模型也能做多语言配音,Kokoro 的价值是轻、快、容易接进真实内容流程。
Kokoro-82M 的官方推理库,可通过 pip 安装,用较小模型完成英语、中文、日语等多语言文字转语音。
- 项目类型
- 轻量语音生成模型
- 运行条件
- Python 3.10–3.13 / 本地或 Colab
- 真实成本
- Apache-2.0;本地硬件、电力与集成成本另计
modelscope/ClearerVoice-Studio
ClearerVoice-Studio
一句话看懂底噪、混响和糊掉的人声先交给它清理,录坏的音频多了一次补救机会。
覆盖语音增强、语音分离、超分辨率和目标说话人提取,并提供预训练模型。
- 项目类型
- 开源语音处理工具
- 运行条件
- Python / Linux 优先 / 本地或 GPU
- 真实成本
- Apache-2.0;模型与第三方组件许可、GPU 和部署成本需核对