5k星星！无GPU都能跑的「开源声音克隆工具」，646种语言，多系统支持一键安装

6599点击 2026-05-29 10:10

ElevenLabs的声音克隆和长文本音频生成质量确实很好，但也太贵了。

最近新出的音频克隆项目不多，今天给大家推荐的这个很有特色，功能很多，而且对显存低的机器很友好，Win/Mac/Linux都支持。

已经点了5k星了。

5k星星！无GPU都能跑的「开源声音克隆工具」，646种语言，多系统支持一键安装

项目简介

OmniVoice Studio是一个全本地运行的ElevenLabs开源替代方案，支持本地语音克隆、设计、创建、配音和听写。

很多自称本地运行的开源音频工具，要么配置极其复杂，要么前端UI极其简陋，根本无法用。

OmniVoice Studio直接提供了跨平台的桌面客户端，直接支持646种语言的声音克隆。

运行原理：

最低内存要求为4GB，内存≤ 8 GB 时，TTS模型会在转录过程中自动卸载到CPU上运行。
内存≥ 8 GB 时，所有操作都会同时在GPU上运行。
没有GPU的情况下，CPU 模式也能运行，只是速度会慢一些，TTS速度大约慢3倍。

功能特点

零样本声音克隆：无需微调训练，只需导入一段3秒钟的目标音频样本，系统就能很快复刻音色。

5k星星！无GPU都能跑的「开源声音克隆工具」，646种语言，多系统支持一键安装

声音设计：用户随意调节声音的性别、年龄、口音、音高、速度、情感乃至地方方言，生成的声线可直接存入本地声音画廊随时调用。

5k星星！无GPU都能跑的「开源声音克隆工具」，646种语言，多系统支持一键安装

电影级视频自动翻配：集成多模态管线，支持直接导入YouTube链接或本地MP4，系统会自动分离人声和背景音，然后进行说话人识别和文本切片，随后一键用克隆音色重组输出新语言的视频。

5k星星！无GPU都能跑的「开源声音克隆工具」，646种语言，多系统支持一键安装

全局悬浮听写组件：按下全局快捷键唤起毛玻璃悬浮窗，直接说话，系统通过本地WebSocket进行流式语音识别，自动把文字粘贴到你当前光标所在的任何输入框内。
原生支持MCP：内置MCP服务端，让你可以直接在 Claude Desktop、Cursor或其他AI Agent客户端中一键配置、直接调用本地的OmniVoice语音能力。
多后端引擎、极低硬件门槛：除了默认模型，系统还原生集成了阿里CosyVoice 3、针对苹果M芯片优化的MLX-Audio（内含Kokoro、Qwen3-TTS）等后端。内置显存智能感知离线机制，在显存小于8G 时会自动将TTS模型移出显存由CPU接管，彻底杜绝显存溢出崩溃。

项目链接

https://github.com/debpalash/OmniVoice-Studio

文章来自于"开源AI项目落地"，作者 "开源AI"。

关键词: AI新闻 , OmniVoice Studio , ElevenLabs , AI声音克隆

AITNT资源拓展

根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考

声音克隆

【开源免费】MockingBird是一个5秒钟即可克隆你的声音的AI项目。
项目地址：https://github.com/babysor/MockingBird

智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的（AI Agents）项目。用户创建的智能体能够自动执行各种任务，从而让AI有步骤的去解决实际问题。
项目地址：https://github.com/Significant-Gravitas/AutoGPT

﻿【开源免费】MetaGPT是一个“软件开发公司”的智能体项目，只需要输入一句话的老板需求，MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色，包括产品经理 / 架构师 / 项目经理 / 工程师，MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址：https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

微调

【开源免费】XTuner 是一个高效、灵活、全能的轻量化大模型微调工具库。它帮助开发者提供一个简单易用的平台，可以对大语言模型（LLM）和多模态图文模型（VLM）进行预训练和轻量级微调。XTuner 支持多种微调算法，如 QLoRA、LoRA 和全量参数微调。
项目地址：https://github.com/InternLM/xtuner

无人直播

【开源免费】VideoChat是一个开源数字人实时对话，该项目支持支持语音输入和实时对话，数字人形象可自定义等功能，首次对话延迟低至3s。
项目地址：https://github.com/Henry-23/VideoChat
在线体验：https://www.modelscope.cn/studios/AI-ModelScope/video_chat

【开源免费】Streamer-Sales 销冠是一个AI直播卖货大模型。该模型具备AI生成直播文案，生成数字人形象进行直播，并通过RAG技术对现有数据进行寻找后实时回答用户问题等AI直播卖货的所有功能。
项目地址：https://github.com/PeterH0323/Streamer-Sales