-
RVC:开源音色转换框架,10 分钟语音数据即可训练,端到端延迟 170 毫秒
RVC 是一个开源的语音音色转换与实时变声框架:官方推荐至少收集 10 分钟低底噪语音数据用于训练,端到端延迟可以做到 170 毫秒,并配有网页界面与实时变声界面,以 MIT 许可证开源。
-
Demucs:开源音源分离模型,命令行一行拆出四条音轨
Demucs 是一个开源的音源分离模型,能把一首歌里的鼓、贝斯与人声分别拆出来;命令行一行即可运行,也能从 Python 直接调用,代码以 MIT 许可证开源。
-
Ultimate Vocal Remover:开源人声分离,干声与伴奏一键提取
UVR 是一个开源的人声分离工具,用先进的音源分离模型把音频拆成人声与伴奏两条音轨;官方安装包已内置界面、Python 与 PyTorch,下载后装上就能用,不需要额外配环境。
-
WhisperX:70 倍实时的开源转写工具,输出词级时间戳与说话人标签
WhisperX 把转写串成流水线:先用 faster-whisper 批量转写,再用 wav2vec2 强制对齐拿到词级时间戳,最后由 pyannote 区分说话人。
-
Buzz:离线转写与翻译音频的桌面工具,由 Whisper 提供支持
Buzz 是一个能在个人电脑上离线转写与翻译音频的桌面工具,由 Whisper 驱动;支持转写音视频文件、麦克风实时转写与说话人识别,结果可导出 SRT 与 VTT 字幕。
-
Whisper:从 3900 万参数到 15.5 亿参数,六种尺寸按显存和精度挑
Whisper 是一个通用语音识别模型,同一个模型就能做多语言转写、翻译与语种判断;提供从 3900 万到 15.5 亿参数的六种尺寸,代码与权重都是 MIT 许可。
-
IndexTTS:本地部署的零样本语音合成,情感强度与语速都能用参数调
IndexTTS 是一个零样本文本转语音系统,一段参考音频就能克隆声音;最新版支持五种语言,还能用情感向量、语速系数与拼音发音控制来调节合成细节,也支持半精度推理与 vLLM 部署。
-
F5-TTS:开源语音合成模型,代码是 MIT 许可而预训练模型限非商用
F5-TTS 是一个用流匹配做语音合成的开源项目,提供 pip 安装、命令行推理与 Gradio 网页界面;代码是 MIT 许可,预训练模型因训练数据限制只能非商用。
-
CosyVoice:零样本克隆声音的开源语音合成,覆盖九种语言与十八种中文方言
CosyVoice 是一个开源的语音合成模型,最新版本 Fun-CosyVoice 3.0 支持零样本跨语言克隆声音,覆盖九种外语与十多种中文方言,以 Apache 2.0 许可证开源。
-
GPT-SoVITS:1 分钟语音数据就能微调出 TTS 模型,5 秒样本即可零样本合成
GPT-SoVITS 是一个开源的语音合成 WebUI:输入 5 秒人声就能零样本合成,1 分钟语音数据即可微调出相似度更高的音色,还支持跨中英日韩粤五种语言推理。
-
本地跑一个文生视频模型:CogVideoX 代码与 2B 模型都是 Apache 2.0
想在本地跑文生视频?CogVideoX 提供 2B 与 5B 多个版本,代码与 2B 模型均为 Apache 2.0 许可,支持 diffusers 与量化推理。
-
通义万相 Wan:开源视频模型从 8.19GB 显存的 1.3B 一路走到 27B 双专家 MoE
通义万相 Wan2.2 用双专家 MoE 把总参数扩到 27B、每步只激活 14B,5B 的 TI2V 模型以 720P 24fps 输出并能跑在消费级显卡上。
-
海螺视频:官方称 H3 的 2K 单价不到主流模型三分之一
海螺视频主推的 MiniMax H3 能把文本、图像、视频与音频放进同一段上下文,生成带原生立体声的视频,最长 15 秒、2K 分辨率,官方称其 2K 每秒价格不到主流模型的三分之一。
-
可图 Kolors:把中文字写对的文生图模型,代码与权重都开源
快手自研的文生图大模型可图(Kolors):代码与权重开源、原生支持中文汉字渲染、可接 ComfyUI 与 Diffusers,图像生成入口现已并入可灵 AI 平台。
-
Flux:Black Forest Labs 把出图与改图合一,4B 开源权重 Apache 2.0
FLUX.2 [klein] 把文生图、图像编辑与多参考生成合并进同一份权重,4B 版以 Apache 2.0 开放可商用,约 13GB 显存即可在消费级显卡上跑起来
-
第 1 / 10 页