由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
项目竞品项目
ggml-org/whisper.cpp
OpenAI Whisper模型的C/C++移植版本
jamiepine/voicebox
开源语音合成工作室
supertone-inc/supertonic
闪电般快速、设备端运行的多语言TTS——通过ONNX原生执行。
microsoft/BitNet
1位量化大语言模型官方推理框架
microsoft/VibeVoice
开源前沿语音人工智能
alibaba/zvec
一款轻量级、极速的进程内向量数据库
modelscope/FunASR
端到端语音识别基础工具包与开源SOTA预训练模型,支持语音识别、语音活动检测、文本后处理等功能。
myshell-ai/OpenVoice
MIT与MyShell联合开发的即时语音克隆技术
fishaudio/fish-speech
顶尖开源文本转语音系统
alphacep/vosk-api
适用于Android、iOS、树莓派及服务端的离线语音识别API,支持Python、Java、C#和Node.js开发语言。
OpenBMB/VoxCPM
VoxCPM:面向上下文感知语音生成与逼真音色克隆的无分词器文本转语音系统
index-tts/index-tts
工业级可控高效的零样本文本转语音系统
RVC-Project/Retrieval-based-Voice-Conversion-WebUI
用不超过10分钟的语音数据轻松训练优质语音克隆模型!
NVIDIA-NeMo/Speech
一个可扩展的生成式 AI 框架,专为从事大语言模型、多模态及语音 AI(自动语音识别与文本转语音)的研究人员和开发者构建。
RVC-Boss/GPT-SoVITS
1分钟的语音数据也可以用来训练一个好的TTS模型! (几张声音克隆镜头)
mudler/LocalAI
🤖 开源免费的OpenAI、Claude及其他AI平台的替代方案。支持自主托管且本地优先,可作为OpenAI的即插即用替代方案运行于消费级硬件,无需GPU。兼容gguf、transformers、diffusers等多种模型架构。功能包括:文本生成、音频处理、视频制作、图像生成、语音克隆、分布式点对点推理。
unslothai/unsloth
大语言模型微调与强化学习 🦥 以2倍速度训练OpenAI gpt-oss、Qwen3、Llama 4、DeepSeek-R1、Gemma 3,节省70%显存
debpalash/VoiceStudio
VoiceStudio 是 ElevenLabs 的开源、完全本地化替代方案 — 提供 646 种语言的语音克隆、语音设计、视频配音、听写、转录和有声读物创建。
firecrawl/pdf-inspector
用于PDF检查、分类和文本提取的快速Rust库。智能检测扫描版与文本版PDF,以实现智能路由决策。
Huanshere/VideoLingo
Netflix级字幕切割、翻译、对齐、甚至加上配音,一键全自动AI视频字幕团队
相关项目推荐
tensorflow/tensorflow
面向所有人的开源机器学习框架
ggml-org/llama.cpp
使用 C/C++ 实现的大语言模型推理框架
react/react-native
一个使用React构建原生应用程序的框架
facebook/react-native
一个使用React构建原生应用程序的框架
electron/electron
使用 JavaScript、HTML 和 CSS 构建跨平台桌面应用程序
godotengine/godot
Godot引擎——跨平台2D与3D游戏引擎