由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
speech-recognition
话题找到数量
huggingface/transformers
🤗 Transformers:面向文本、视觉、音频及多模态模型的尖端机器学习模型定义框架,支持推理与训练全流程。
alphacep/vosk-api
适用于Android、iOS、树莓派及服务端的离线语音识别API,支持Python、Java、C#和Node.js开发语言。
NVIDIA/DeepLearningExamples
按模型组织的尖端深度学习脚本——易于在企业级基础设施上进行训练和部署,并具备可复现的准确性与性能。
kmario23/deep-learning-drizzle
通过聆听这些精彩讲座,沉浸式学习深度学习、强化学习、机器学习、计算机视觉和自然语言处理!!
abus-aikorea/voice-pro
为创作者和开发者打造的Gradio WebUI,具备核心TTS功能(Edge-TTS、kokoro)和零样本声音克隆(E2与F5-TTS、CosyVoice),并集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。
fikrikarim/parlor
设备端实时多模态AI。与完全运行在您本机上的AI进行自然的语音和视觉对话,由Gemma 4 E2B和Kokoro驱动。
matthiasn/lotti
开源私人日志本,内置本地智能代理层。长期运行的 AI 代理会读取你的记录并建议下一步行动。在硬件允许的情况下,模型也可在本地运行。采用 Matrix 与 Vodozemac 实现设备间的端到端加密同步。
soniqo/speech-swift
面向 Apple Silicon 的 AI 语音工具包 — 基于 MLX 和 CoreML 的 ASR、TTS、语音到语音、VAD 及说话人分离功能。
CrispStrobe/CrispASR
面向多语言ASR与TTS模型的C++ ggml运行时中心:支持Cohere Transcribe、Parakeet TDT、Voxtral、Canary 1B v2等,并集成通用强制对齐等功能