本地 Web 创意引擎,提供统一画布、局部重绘、画笔、节点工作流、素材图库和 API 扩展。
本地生成与局部重绘 →十大分类 · 06
视频、图片与声音
从剪辑、字幕、配音、数字人到视觉创作,先算清模型和算力账。
这一类正在用的软件
26 个软件,逐个对应 GitHub 解法。
先点你已经在用的商业软件;右侧明确写出 GitHub 项目属于可替代、降低成本、提高效率还是自动化,不把它们混在一起讲。
像搭积木一样把模型、提示词、参考图和处理步骤连起来,搭好一次就能反复生成图片、视频、音频和 3D 内容。
组合可复用图片工作流 →模块化 AI 图片生成 WebUI,兼顾简化生成页和高级 Comfy 节点流程,支持 Stable Diffusion、Flux 等模型;目前仍处 Beta。
本地图片生成工作台 →字节 Seed 团队的统一多模态模型,覆盖视觉理解、文生图、图片编辑和自由视觉操作,并提供 Gradio 界面。
开源多模态生成编辑 →离线图片生成器,强调少调参数的提示词体验,并支持变体、放大、局部重绘和扩图。
本地简化出图 →把生成式填充、实时绘画、放大、参考图、ControlNet 和分区提示放进 Krita 的绘画与修图流程。
编辑器内生成式修改 →Stability AI 官方生成模型代码库,提供 SDXL 基础与精修模型的文生图、图生图和 Streamlit 推理示例。
官方模型与推理入口 →以 CapCut 开源替代为目标的时间线视频编辑器,面向裁剪、拼接、素材编排和导出等日常工作。项目仍在快速重写,正式使用前可先核对 classic 版本。
开源剪辑候选 →KDE 维护的免费开源非线性视频编辑器,适合多轨剪辑、转场以及视频和音频效果处理。
成熟多轨剪辑 →把 CapCut 风格多轨时间线、自动字幕、多语言配音、本地 AI 音乐、画面修复、智能裁切、数字人和离线导出放进浏览器;还提供 Codex、Claude Code、Copilot 与 Gemini 可调用的视频编辑 Skill。
本地多轨剪辑工作台 →腾讯混元视频生成模型,覆盖文生视频、图生视频、480p/720p、超分辨率,并提供 Diffusers 与 ComfyUI 路线。
开源文生与图生视频 →开源视频生成模型,README 列出文生视频、图生视频、首尾帧视频、视频编辑、文生图与视频音频等任务。
多任务视频模型路线 →把研究、脚本、素材、配音、字幕、时间线、渲染和质检串成整片视频生产流程;可接商业模型,也有免费素材与本地工具路线。
把模型接进整片生产 →不只把一张图变成短片:它能用多个关键帧控制过程、向前或向后续写、做视频转视频;新一代 LTX-2 还把画面与声音一起生成。
多关键帧与视频延长 →给一张人物图和一段声音,就能让真人、动漫角色或动物开口说话;同一仓库还支持文生视频、图生视频和长视频续写。
本地视频生成候选 →从主题出发自动串接文案、素材或视频生成、配音、背景音乐和视频合成的 AI 视频生产流程。
主题到短片自动合成 →从一个故事大纲自动生成剧情拆解、角色设计、分镜图和逐场视频,最后合成为完整成片。支持横屏与竖屏,并可连接 Veo、Kling、Seedance、Wan 等视频模型。
分镜到整片工作流 →用源图片或视频配合驱动视频生成肖像动画,支持人物、猫狗、姿态编辑、区域控制和视频转视频;用户已完成真实安装与成片测试。
补肖像动画能力 →通过逐段预测和固定长度上下文生成视频,提供桌面界面,适合图片转视频及较长视频实验。
较低显存图片转视频 →实时交互式流媒体数字人引擎:输入文字或音频即可驱动虚拟形象实时口型同步,并可通过 WebRTC、RTMP 或虚拟摄像头输出。
数字人与实时口型 →Z.ai 官方视频生成仓库,覆盖文生视频、图生视频和视频续写,并提供推理与微调工具。
自行部署视频模型 →集成 16 个语音合成引擎和 11 个语音识别引擎,可做零样本声音克隆、视频配音、系统听写、多人故事、有声书、说话人分离和批量生成。声音、项目与输出默认留在本机。
本地配音与声音克隆 →支持文本生成音乐、多语言歌词、参考音频、翻唱、局部重绘、音轨分离和时长控制。
本地歌曲生成与编辑 →支持多语言和中文方言的零样本语音合成、跨语言声音克隆、情绪与语速控制、流式输出及服务端部署。
中文方言与流式语音 →Kokoro-82M 的官方推理库,可通过 pip 安装,用较小模型完成英语、中文、日语等多语言文字转语音。
轻量多语言旁白 →覆盖语音增强、语音分离、超分辨率和目标说话人提取,并提供预训练模型。
降噪、分离与语音增强 →第一层 · 市面上通常怎么做
先看你正在为谁付费。
这里只列大众常见的商业工具,目的不是替它们推销,而是先明确它们解决什么工作、如何计费,以及成本从哪里开始增加。
CapCut Pro
短视频剪辑、字幕、模板、特效和部分 AI 视频能力。
- 官方价格 / 计费方式
- 官方美国说明列月付 US$19.99、年付 US$179.99;不同地区、设备与促销会变化。
- 真正的成本痛点
- 常用 AI 功能、无水印、高分辨率和素材可能进入订阅档。
HeyGen
数字人、口播视频、配音、翻译与视频生成。
- 官方价格 / 计费方式
- Creator:US$29 / 月;免费档每月 3 条、每条最长 1 分钟。计费方式正在向 credits 演进。
- 真正的成本痛点
- 分钟数、credits、数字人引擎和 API 使用会让“单月订阅”之外出现额外成本。
第二层 · GitHub 从这里介入
用 GitHub 解决成本与效率问题
针对上一层商业软件的费用、能力缺口或重复流程,这里给出开源替代、增强工具和自动化方案。每个项目都标出许可、运行条件和真实成本,方便判断是否适合你。
immich-app/immich
Immich
一句话看懂将手机照片和视频备份到自己的服务器,并按人物、地点和内容搜索。
将手机照片和视频备份到自己的服务器,并按人物、地点和内容搜索。
- 项目类型
- 个人照片与视频备份
- 运行条件
- iOS、Android、浏览器;需服务器、硬盘和持续备份
- 真实成本
- 待核验
iv-org/invidious
Invidious
一句话看懂用轻量、少追踪的界面搜索和观看 YouTube。
用轻量、少追踪的界面搜索和观看 YouTube。
- 项目类型
- 轻量视频前端
- 运行条件
- 浏览器;自托管需 Docker 或 Linux 服务器
- 真实成本
- 待核验
3b1b/manim
ManimGL
一句话看懂将公式、几何和数学推导制作成可重复修改的动画。
将公式、几何和数学推导制作成可重复修改的动画。
- 项目类型
- 数学动画引擎
- 运行条件
- macOS 或 Linux;Python、FFmpeg、OpenGL,部分场景需 LaTeX
- 真实成本
- 待核验
averygan/reclip
Reclip
一句话看懂在自托管网页中下载和整理获准保存的在线视频。
在自托管网页中下载和整理获准保存的在线视频。
- 项目类型
- 在线视频保存与整理
- 运行条件
- yt-dlp、FFmpeg、Python 或 Docker
- 真实成本
- 待核验
codeforreal1/compressO
CompressO
一句话看懂本地批量压缩、裁剪、转换视频和图片,并处理字幕及元数据。
本地批量压缩、裁剪、转换视频和图片,并处理字幕及元数据。
- 项目类型
- 本地媒体处理工具
- 运行条件
- Windows、macOS、Linux;依赖本机算力与 FFmpeg
- 真实成本
- 待核验
mifi/lossless-cut
LosslessCut
一句话看懂少重新编码地裁剪、拼接视频,并处理音轨、字幕和封装。
少重新编码地裁剪、拼接视频,并处理音轨、字幕和封装。
- 项目类型
- 无损视频剪切工具
- 运行条件
- Windows、macOS、Linux;兼容性取决于 FFmpeg 和源文件
- 真实成本
- 待核验
jub0t/Concat
Concat
一句话看懂本地完成多轨剪辑、字幕、配音、变速和模板复用。
本地完成多轨剪辑、字幕、配音、变速和模板复用。
- 项目类型
- 本地视频剪辑器
- 运行条件
- Windows、macOS、Linux;目前仍为 Beta
- 真实成本
- 待核验
realskyrin/capcap
CapCap
一句话看懂本地完成截图、长截图、标注、OCR、翻译和钉图。
本地完成截图、长截图、标注、OCR、翻译和钉图。
- 项目类型
- 本地截图工具
- 运行条件
- macOS 14+
- 真实成本
- 待核验
ArcReel/ArcReel
ArcReel
一句话看懂将小说或剧本转成角色、分镜、视频和剪映草稿。
将小说或剧本转成角色、分镜、视频和剪映草稿。
- 项目类型
- 小说视频化工作流
- 运行条件
- Docker;图像、视频和配音服务另配
- 真实成本
- 待核验
OpenCut-app/OpenCut
OpenCut
一句话看懂把日常剪辑留在开源工作台里,让时间线、素材和导出不再被订阅入口锁住。
以 CapCut 开源替代为目标的时间线视频编辑器,面向裁剪、拼接、素材编排和导出等日常工作。项目仍在快速重写,正式使用前可先核对 classic 版本。
- 项目类型
- 开源应用
- 运行条件
- Web / 桌面路线
- 真实成本
- MIT;软件免费,模型、素材和运行环境成本另计
meituan-longcat/LongCat-Video
LongCat-Video
一句话看懂一张图加一段声音,就能让真人、动漫角色或动物自然开口说话。
给一张人物图和一段声音,就能让真人、动漫角色或动物开口说话;同一仓库还支持文生视频、图生视频和长视频续写。
- 项目类型
- 开源视频与数字人模型
- 运行条件
- Python / CUDA GPU / Docker
- 真实成本
- MIT;代码与模型开放,本地或云 GPU 成本另计
lipku/LiveTalking
LiveTalking
一句话看懂输入文字或声音,就能让数字人实时开口并推到网页、直播间或虚拟摄像头。
实时交互式流媒体数字人引擎:输入文字或音频即可驱动虚拟形象实时口型同步,并可通过 WebRTC、RTMP 或虚拟摄像头输出。
- 项目类型
- 开源项目
- 运行条件
- 云 GPU 候选
- 真实成本
- 开源代码,运行成本待核算
KlingAIResearch/LivePortrait
LivePortrait
一句话看懂一张照片加一段驱动视频就能让肖像自然开口和转头,它是高效肖像动画的代表性开源路线。
用源图片或视频配合驱动视频生成肖像动画,支持人物、猫狗、姿态编辑、区域控制和视频转视频;用户已完成真实安装与成片测试。
- 项目类型
- 肖像动画模型
- 运行条件
- Windows / Linux / Apple Silicon Mac
- 真实成本
- 开源代码与权重;本地算力或云 GPU 成本另计
debpalash/VoiceStudio
VoiceStudio
一句话看懂在本机完成声音克隆、视频配音、听写和有声书制作,核心流程无需账号、API Key 或订阅。
集成 16 个语音合成引擎和 11 个语音识别引擎,可做零样本声音克隆、视频配音、系统听写、多人故事、有声书、说话人分离和批量生成。声音、项目与输出默认留在本机。
- 项目类型
- 本地语音工作台
- 运行条件
- macOS Apple Silicon / Windows / Linux / Docker
- 真实成本
- AGPL-3.0;核心流程无需账号或订阅,模型、硬件和可选远程服务另计
QuentinFuxa/WhisperLiveKit
WhisperLiveKit
一句话看懂把正在说的话实时变成字幕,同时区分说话人、翻译并输出兼容 API。
本地实时语音识别与转写工具,覆盖流式识别、说话人分离、翻译和兼容 API。
- 项目类型
- 开源工具
- 运行条件
- 待核验
- 真实成本
- 待核算
ATH-MaaS/Pixelle-Video
Pixelle-Video
一句话看懂给一个主题,它就把文案、画面、配音、音乐和合成串成一条自动出片流水线。
从主题出发自动串接文案、素材或视频生成、配音、背景音乐和视频合成的 AI 视频生产流程。
- 项目类型
- 开源模型
- 运行条件
- 待核验
- 真实成本
- 待核算
Comfy-Org/ComfyUI
ComfyUI
一句话看懂像搭积木一样保存和复用整条生成流程,一套工作流反复产出图片、视频、音频和 3D。
像搭积木一样把模型、提示词、参考图和处理步骤连起来,搭好一次就能反复生成图片、视频、音频和 3D 内容。
- 项目类型
- 节点式生成工作流
- 运行条件
- Windows / macOS / Linux / 本地或云端
- 真实成本
- GPL-3.0;软件免费,模型、显卡、云 GPU 和工作流维护另计
Wan-Video/Wan2.1
Wan2.1
一句话看懂用同一套开放模型完成文生视频、图生视频、首尾帧控制、视频编辑和声音生成。
开源视频生成模型,README 列出文生视频、图生视频、首尾帧视频、视频编辑、文生图与视频音频等任务。
- 项目类型
- 开源视频模型
- 运行条件
- Python / NVIDIA GPU;部分模型可用消费级显卡
- 真实成本
- Apache-2.0;代码和权重路线免费,GPU/云端推理成本另计
Tencent-Hunyuan/HunyuanVideo-1.5
HunyuanVideo 1.5
一句话看懂把腾讯混元的视频生成模型、权重和推理代码跑到自己的 GPU 或 ComfyUI 工作流里。
腾讯混元视频生成模型,覆盖文生视频、图生视频、480p/720p、超分辨率,并提供 Diffusers 与 ComfyUI 路线。
- 项目类型
- 开源视频模型
- 运行条件
- Linux / Python 3.10+ / NVIDIA GPU;模型卸载时官方最低约 14GB 显存
- 真实成本
- 项目采用专用许可;模型、商业使用、算力、存储和云 GPU 成本需逐项核对
Lightricks/LTX-Video
LTX-Video
一句话看懂用关键帧决定视频怎样发展、向前或向后续写,并让新一代模型同步生成画面与声音。
不只把一张图变成短片:它能用多个关键帧控制过程、向前或向后续写、做视频转视频;新一代 LTX-2 还把画面与声音一起生成。
- 项目类型
- 开源视频模型
- 运行条件
- Python / NVIDIA GPU / ComfyUI / 在线试玩
- 真实成本
- Apache-2.0;模型、显卡、云 GPU 或在线服务成本另计
MartinDelophy/ai-video-editor
Timeline Studio
一句话看懂在浏览器里完成多轨剪辑、字幕、配音、AI 修复和离线导出,素材尽量留在本地。
把 CapCut 风格多轨时间线、自动字幕、多语言配音、本地 AI 音乐、画面修复、智能裁切、数字人和离线导出放进浏览器;还提供 Codex、Claude Code、Copilot 与 Gemini 可调用的视频编辑 Skill。
- 项目类型
- 本地优先 AI 视频编辑器
- 运行条件
- 桌面浏览器 / PWA / WebGPU
- 真实成本
- MIT;编辑器免费,浏览器模型需要本地算力与存储
invoke-ai/InvokeAI
InvokeAI
一句话看懂生成、局部重绘、画布和节点流程放到一起,图片创作终于能反复修改而不是只抽卡。
本地 Web 创意引擎,提供统一画布、局部重绘、画笔、节点工作流、素材图库和 API 扩展。
- 项目类型
- 生成式图片工作台
- 运行条件
- 本地 Web UI / GPU
- 真实成本
- 主代码 Apache-2.0;模型许可、显卡、云算力与商业 API 费用另计
mcmonkeyprojects/SwarmUI
SwarmUI
一句话看懂简单出图和高级 Comfy 工作流共用一个界面,新手与重度用户都不用换工具。
模块化 AI 图片生成 WebUI,兼顾简化生成页和高级 Comfy 节点流程,支持 Stable Diffusion、Flux 等模型;目前仍处 Beta。
- 项目类型
- 图片生成 WebUI
- 运行条件
- Windows / macOS / Linux;本地或云 GPU
- 真实成本
- MIT;模型许可、显卡与云算力另计
ByteDance-Seed/BAGEL
BAGEL
一句话看懂同一套模型既能看图、出图又能改图,字节 Seed 的开源多模态路线值得实测。
字节 Seed 团队的统一多模态模型,覆盖视觉理解、文生图、图片编辑和自由视觉操作,并提供 Gradio 界面。
- 项目类型
- 统一多模态模型
- 运行条件
- Python / Gradio / CUDA GPU
- 真实成本
- Apache-2.0;完整或量化推理仍需较高显存,算力与存储另计
lllyasviel/Fooocus
Fooocus
一句话看懂少调参数也能在本地专注提示词出图,它是最接近 Midjourney 简化体验的开源路线之一。
离线图片生成器,强调少调参数的提示词体验,并支持变体、放大、局部重绘和扩图。
- 项目类型
- 本地图片生成器
- 运行条件
- Windows / Linux / Colab;NVIDIA GPU 优先
- 真实成本
- GPL-3.0;模型、显卡和存储另计,项目处于有限维护状态
Acly/krita-ai-diffusion
Krita AI Diffusion
一句话看懂在 Krita 里边画边生成、局部重绘,AI 不再和真正的修图流程分家。
把生成式填充、实时绘画、放大、参考图、ControlNet 和分区提示放进 Krita 的绘画与修图流程。
- 项目类型
- Krita 生成式编辑插件
- 运行条件
- Krita 5.2+;Windows / macOS / Linux
- 真实成本
- GPL-3.0;本地 GPU、模型或云生成费用另计
lllyasviel/stable-diffusion-webui-forge
Stable Diffusion WebUI Forge
一句话看懂更省显存地管理模型、LoRA 和 ControlNet,本地出图工作台更容易跑起来。
在 Stable Diffusion WebUI 基础上优化资源管理和推理速度,兼容常用模型、LoRA、ControlNet 与扩展。
- 项目类型
- 本地图片生成 WebUI
- 运行条件
- Windows 一键包 / Python 自托管
- 真实成本
- AGPL-3.0;模型许可、显卡与云 GPU 另计
Kwai-Kolors/Kolors
Kolors
一句话看懂中文和英文文字也能直接进画面,做海报时终于不必默认字一定会崩。
快手团队的中英双语文生图模型,强调复杂语义与中英文文字渲染,并支持 Gradio、ComfyUI、局部重绘和 ControlNet。
- 项目类型
- 中英双语图片模型
- 运行条件
- Python / Gradio / ComfyUI / NVIDIA CUDA
- 真实成本
- 代码 Apache-2.0;模型权重另有许可,商业使用与算力成本需核对
Stability-AI/generative-models
Stability Generative Models
一句话看懂从 Stability AI 官方代码进入 SDXL,模型来源、推理示例和许可边界更清楚。
Stability AI 官方生成模型代码库,提供 SDXL 基础与精修模型的文生图、图生图和 Streamlit 推理示例。
- 项目类型
- 官方生成模型代码库
- 运行条件
- Python 3.10 / CUDA / Streamlit
- 真实成本
- 代码 MIT;各模型权重许可、算力与存储需分别核对
KDE/kdenlive
Kdenlive
一句话看懂专业时间线、转场和音频处理都能留在本地,Kdenlive 是成熟的开源剪辑主力。
KDE 维护的免费开源非线性视频编辑器,适合多轨剪辑、转场以及视频和音频效果处理。
- 项目类型
- 开源视频编辑器
- 运行条件
- Windows / macOS / Linux
- 真实成本
- GPL-3.0;本地使用免费,素材、插件、存储与硬件成本另计
lllyasviel/FramePack
FramePack
一句话看懂一张图就能逐段生成更长视频,较低显存也多了一条可研究的本地路线。
通过逐段预测和固定长度上下文生成视频,提供桌面界面,适合图片转视频及较长视频实验。
- 项目类型
- 本地视频生成工具
- 运行条件
- Windows / Linux / NVIDIA RTX 30、40、50 系;最低 6GB 显存
- 真实成本
- Apache-2.0;模型下载、显卡、电力或云 GPU 成本另计
zai-org/CogVideo
CogVideo / CogVideoX
一句话看懂文字、参考图和已有片段都能进入视频流程,Sora 类任务有了可自行部署的候选。
Z.ai 官方视频生成仓库,覆盖文生视频、图生视频和视频续写,并提供推理与微调工具。
- 项目类型
- 开源视频生成模型
- 运行条件
- Python / NVIDIA GPU / Colab
- 真实成本
- 代码与不同权重许可不完全相同;算力、存储与商业条件需逐项核对
ace-step/ACE-Step-1.5
ACE-Step 1.5
一句话看懂从一句描述到完整歌曲,还能翻唱、重绘和拆音轨,音乐生成可以留在本机。
支持文本生成音乐、多语言歌词、参考音频、翻唱、局部重绘、音轨分离和时长控制。
- 项目类型
- 开源音乐生成模型
- 运行条件
- Windows / macOS / Linux;CUDA、Apple Silicon、ROCm、Intel XPU 或 CPU
- 真实成本
- MIT;硬件、云算力和电力成本另计,生成内容仍需核对版权风险
QwenAudio/CosyVoice
CosyVoice
一句话看懂中文、方言、跨语言克隆和流式输出都在一套模型里,很适合搭自己的语音服务。
支持多语言和中文方言的零样本语音合成、跨语言声音克隆、情绪与语速控制、流式输出及服务端部署。
- 项目类型
- 开源语音生成模型
- 运行条件
- Python / Linux / Docker / NVIDIA GPU
- 真实成本
- Apache-2.0;模型和第三方组件许可、显卡与部署成本需逐项核对
hexgrad/kokoro
Kokoro
一句话看懂小模型也能做多语言配音,Kokoro 的价值是轻、快、容易接进真实内容流程。
Kokoro-82M 的官方推理库,可通过 pip 安装,用较小模型完成英语、中文、日语等多语言文字转语音。
- 项目类型
- 轻量语音生成模型
- 运行条件
- Python 3.10–3.13 / 本地或 Colab
- 真实成本
- Apache-2.0;本地硬件、电力与集成成本另计
modelscope/ClearerVoice-Studio
ClearerVoice-Studio
一句话看懂底噪、混响和糊掉的人声先交给它清理,录坏的音频多了一次补救机会。
覆盖语音增强、语音分离、超分辨率和目标说话人提取,并提供预训练模型。
- 项目类型
- 开源语音处理工具
- 运行条件
- Python / Linux 优先 / 本地或 GPU
- 真实成本
- Apache-2.0;模型与第三方组件许可、GPU 和部署成本需核对
CapSoftware/Cap
Cap
一句话看懂录屏、简单剪辑、字幕和分享链接都在一套开源工具里,教程和演示视频能更快发出去。
录制屏幕、摄像头和麦克风后,可在本地修剪、加字幕、导出或生成分享链接;适合教程、产品演示和异步沟通。
- 项目类型
- 开源录屏与演示视频工具
- 运行条件
- macOS / Windows;可选 Docker 自托管
- 真实成本
- 待核验
remsky/Kokoro-FastAPI
Kokoro-FastAPI
一句话看懂给本地工作流补上一条兼容 OpenAI 的配音接口,长文、多角色和字幕时间轴都能一次生成。
将 Kokoro 语音模型包装成兼容 OpenAI 的本地配音服务,支持多语言、多说话人、声音混合、SSML 与带时间戳的字幕。
- 项目类型
- 本地语音合成服务
- 运行条件
- Docker;CPU、NVIDIA/AMD GPU 或 Apple Silicon 原生运行
- 真实成本
- 待核验
KartikLabhshetwar/better-shot
BetterShot
一句话看懂Mac 上截图、录屏、字幕、自动缩放和简单剪辑一次完成,教程视频录完就能直接修。
在 Mac 上完成截图标注、OCR、带系统声音与摄像头的录屏,再用多片段时间线剪辑、自动缩放和本地字幕整理成教程或演示视频。
- 项目类型
- Mac 截图、录屏与视频编辑器
- 运行条件
- macOS;Homebrew 或 DMG 安装;需屏幕录制与辅助功能权限
- 真实成本
- 待核验
Anil-matcha/Open-Generative-AI
Open Generative AI
一句话看懂把 500 多个图片、视频、口型同步和创意模型收进一个可自托管的生成工作台。
用统一界面组织 Flux、Kling、Sora、Veo 等 500 多个模型路线,覆盖图像与视频生成、编辑和口型同步。最短上手是部署网页应用并配置要使用的模型服务;例如在同一项目里先生成产品图,再把图片转成短视频并完成口型同步,不用来回切换多个平台。开源的是工作台,各模型和算力不一定免费。
- 项目类型
- 自托管图像与视频生成工作台
- 运行条件
- JavaScript / 浏览器 / 自托管服务器;需接入相应模型服务
- 真实成本
- MIT;应用免费,模型 API、GPU、存储和服务器成本另计
Moh4696/freecut
Freecut
一句话看懂把素材交给 Codex 或 Claude Code,Agent 就能按文字要求剪片、做字幕、转场和动画叠加。
基于 video-use,把付费 ElevenLabs 转写替换为本地 Whisper 等免费可插拔方案,让编程 Agent 直接参与素材分级、剪辑、字幕、转场和动画叠加。最短上手是准备 Python、FFmpeg 和本地转写环境,再让 Codex 或 Claude Code 操作仓库;例如要求它从一段长录屏里保留重点、补字幕并导出短版。
- 项目类型
- Agent 驱动的本地视频剪辑工具
- 运行条件
- Python / 本地电脑 / FFmpeg / Codex 或 Claude Code
- 真实成本
- MIT;软件与本地转写免费,模型和本地算力成本另计
freestylefly/awesome-gpt-image-2
Awesome GPT Image 2
一句话看懂从 530 多个真实案例和 20 多套模板里拆出可复用的 GPT-Image-2 提示词与风格 Skill。
它把 530 多个 GPT-Image-2 案例和 20 多套模板整理成可安装的提示词 Skill。本站已实际安装 gpt-image-2-style-library,选用信息图模板生成一份结构化中文提示词,并据此做出一张实验信息图。它不是图像模型;本次验证的是提示词工作流,GPT Image 2 或其他渲染模型仍可能收费,案例图片也不自动获得商用授权。
- 项目类型
- GPT-Image-2 提示词案例、模板与 Skill 库
- 运行条件
- 浏览器 / 支持 Skills 的 Agent / GPT-Image-2 或兼容图像服务
- 真实成本
- MIT;代码与模板开放,模型生成费用另计;第三方案例和图片不自动获得商业授权
music-assistant/server
Music Assistant
一句话看懂把不同音乐服务和家里的联网音箱统一管理,并接进 Home Assistant 做播放自动化。
把不同音乐服务、本地曲库和多个品牌的联网音箱放进同一套媒体库与播放控制里,再通过 Home Assistant 做场景、房间和定时播放自动化。
- 项目类型
- 多音乐服务与联网音箱统一管理器
- 运行条件
- Home Assistant 插件或 Docker;需常开 Raspberry Pi、NAS、NUC 等设备
- 真实成本
- 待核验
browser-use/video-use
video-use
一句话看懂把一句剪辑要求交给编程 Agent,直接从素材文件夹生成视频。
让 coding agent 读取素材、转写、裁切、叠加字幕并导出成片,适合测试自然语言剪辑能否真正完成一条实验室视频。
- 项目类型
- Agent 视频剪辑
- 运行条件
- Python / ffmpeg / yt-dlp;需要模型与视频处理依赖
- 真实成本
- MIT;模型 API、素材和本地渲染成本另计
oboroge0/hayamimi
早耳 hayamimi
一句话看懂不用 GPU、云服务或高配电脑,也能把实时多语种语音变成字幕。
纯 CPU 实时多语种转写引擎,提供浏览器面板、说话人标签和翻译字幕;适合测试低成本字幕路线。
- 项目类型
- 本地实时语音转文字
- 运行条件
- Python / CPU / 约 2GB RAM;浏览器面板
- 真实成本
- MIT;无需云 API,硬件与本地部署成本另计
Anil-matcha/Open-AI-UGC
Open AI UGC
一句话看懂不用真人出镜,也能用 AI 演员为商品和服务制作口播式 UGC 广告。
用虚拟演员、口播、字幕和视频模型制作 TikTok/Reels 风格商品广告,让不方便真人出镜的商家或内容工作室也能批量试不同脚本和人物。
- 项目类型
- AI 演员 UGC 广告制作台
- 运行条件
- Next.js 自托管;需 MUAPI 等生成服务、模型额度和部署环境;带 Stripe 的 SaaS 模板路线
- 真实成本
- 待核验
datascale-ai/opentalking
OpenTalking
一句话看懂把数字人、声音、知识库和实时对话接成可私有部署的直播与讲解工作台。
把数字人形象、声音、知识库、记忆和实时对话接成完整链路,可用于直播讲解、店铺导购、课程助教或远程咨询。
- 项目类型
- 实时数字人与私有化讲解系统
- 运行条件
- Mock 模式可用 CPU 试流程;真实口型与实时渲染通常需 Python、Node.js、FFmpeg、模型和 8GB+ 显存 GPU
- 真实成本
- 待核验
motiful/product-shots
Product Shots
一句话看懂给一张商品照片,就能生成主图、详情页、多角度模特图、广告图和社媒素材。
从一张 SKU 照片生成 Amazon 主图、A+ 详情页、多角度模特图、广告创意和社媒素材,适合跨境卖家或商品视觉代做服务建立标准化交付。
- 项目类型
- 电商商品图 Agent Skills
- 运行条件
- Claude Code、Codex、Cursor、Windsurf 等支持 Skills 的 Agent;需兼容图像生成接口并人工检查商品一致性
- 真实成本
- 待核验
pexoai/pexo-skills
Pexo Skills
一句话看懂给一张商品图或商品链接,就能批量生成带口播、字幕、音乐和转场的多尺寸广告短片。
给一张商品图、商品链接或一句创意要求,生成脚本、多镜头画面、配音、音乐、字幕和转场,并批量输出 9:16、16:9 与 1:1 广告版本。
- 项目类型
- 商品广告多媒体 Agent Skills
- 运行条件
- 支持 Agent Skills 的客户端;安装需 Node.js/npx,实际生成需 Pexo API Key
- 真实成本
- 待核验
AtlasCloudAI/atlas-marketing-studio
Atlas Marketing Studio
一句话看懂把商品照、人物照或参考广告变成 UGC、短剧和双人段子式电商广告。
用商品照、人物照、商品链接或参考广告生成 UGC 口播、参考广告翻拍、短剧广告和双人段子,适合社交电商快速试多种创意。
- 项目类型
- 自托管电商视频广告工作台
- 运行条件
- Node.js / Next.js;自托管需 Atlas Cloud API、数据库、对象存储和 OAuth,支付模块可选
- 真实成本
- 待核验
danielgatis/rembg
rembg
一句话看懂整批商品照片自动去掉背景,快速变成能继续制作主图和广告图的透明素材。
自动去除单张或整批商品照片的背景,输出透明图片,直接交给主图、详情页、广告图和短视频继续制作。它承担商品视觉流水线里的第一步。
- 项目类型
- 商品图片批量抠图工具
- 运行条件
- Python 3.11–3.13;命令行、Python 库、HTTP 服务或 Docker;支持 CPU 与 GPU
- 真实成本
- MIT;代码免费,部分可选模型另有各自许可证