由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
项目竞品项目
harry0703/MoneyPrinterTurbo
利用AI大模型一键生成高清短视频
debpalash/VoiceStudio
VoiceStudio 是 ElevenLabs 的开源、完全本地化替代方案 — 提供 646 种语言的语音克隆、语音设计、视频配音、听写、转录和有声读物创建。
calesthio/OpenMontage
全球首个开源智能体视频制作系统,集成12条流水线、52种工具及500余项智能体技能,可将您的AI编程助手转变为完整的视频制作工作室。
huggingface/speech-to-speech
语音转语音:致力于构建开源模块化GPT4-o的项目
abus-aikorea/voice-pro
为创作者和开发者打造的Gradio WebUI,具备核心TTS功能(Edge-TTS、kokoro)和零样本声音克隆(E2与F5-TTS、CosyVoice),并集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。
RVC-Boss/GPT-SoVITS
1分钟的语音数据也可以用来训练一个好的TTS模型! (几张声音克隆镜头)
OpenBMB/VoxCPM
VoxCPM:面向上下文感知语音生成与逼真音色克隆的无分词器文本转语音系统
myshell-ai/OpenVoice
MIT与MyShell联合开发的即时语音克隆技术
index-tts/index-tts
工业级可控高效的零样本文本转语音系统
modelscope/FunASR
端到端语音识别基础工具包与开源SOTA预训练模型,支持语音识别、语音活动检测、文本后处理等功能。
cjpais/Handy
完全离线的免费开源可扩展语音转文本应用程序
supertone-inc/supertonic
闪电般快速、设备端运行的多语言TTS——通过ONNX原生执行。
screenpipe/screenpipe
screenpipe将您的电脑转变为个人AI助手,它能知晓您的一切操作。记录、搜索、自动化,全部本地运行,完全私密,尽在您掌控。
mozilla-ai/llamafile
用单个文件分发和运行大语言模型。
k2-fsa/sherpa-onnx
基于新一代Kaldi与onnxruntime的离线语音转文字、文字转语音、说话人日志、语音增强、源分离及语音活动检测技术。支持嵌入式系统、Android、iOS、HarmonyOS、树莓派、RISC-V架构、x86_64服务器、WebSocket服务端/客户端,兼容12种编程语言。
unslothai/unsloth
大语言模型微调与强化学习 🦥 以2倍速度训练OpenAI gpt-oss、Qwen3、Llama 4、DeepSeek-R1、Gemma 3,节省70%显存
alphacep/vosk-api
适用于Android、iOS、树莓派及服务端的离线语音识别API,支持Python、Java、C#和Node.js开发语言。
ggml-org/whisper.cpp
OpenAI Whisper模型的C/C++移植版本
Blaizzy/mlx-audio
基于 Apple MLX 框架构建的文本转语音 (TTS)、语音转文本 (STT) 和语音转语音 (STS) 库,可在 Apple Silicon 上提供高效的语音分析。
Osmantic/ODS
将您的PC、Mac或Linux设备转变为AI服务器,支持大语言模型推理、聊天界面、语音、智能体、工作流、RAG及图像生成。
相关项目推荐
public-apis/public-apis
免费API资源汇总列表
EbookFoundation/free-programming-books
📚 免费提供的编程书籍
vinta/awesome-python
回答“我想用 Python 做 X,我应该使用哪个工具?”的最终列表。
practical-tutorials/project-based-learning
基于项目的教程精选列表
NousResearch/hermes-agent
与你共同成长的智能体
TheAlgorithms/Python
所有算法均使用Python实现