由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

speech-recognition

话题找到数量

huggingface/transformers

🤗 Transformers:面向文本、视觉、音频及多模态模型的尖端机器学习模型定义框架,支持推理与训练全流程。

166k
34k
1.8k
+1.3k
排名 #10
9月16日
查看详情

ggml-org/whisper.cpp

OpenAI Whisper模型的C/C++移植版本

53k
6.2k
2.2k
+173
排名 #9
9月16日
查看详情

modelscope/FunASR

端到端语音识别基础工具包与开源SOTA预训练模型,支持语音识别、语音活动检测、文本后处理等功能。

18k
1.9k
1.3k
+2.1k
排名 #14
6月30日
查看详情

alphacep/vosk-api

适用于Android、iOS、树莓派及服务端的离线语音识别API,支持Python、Java、C#和Node.js开发语言。

15k
1.8k
1k
+27
排名 #16
9月6日
查看详情

NVIDIA/DeepLearningExamples

按模型组织的尖端深度学习脚本——易于在企业级基础设施上进行训练和部署,并具备可复现的准确性与性能。

14k
3.4k
1.1k
排名 #8
5月16日
查看详情

kmario23/deep-learning-drizzle

通过聆听这些精彩讲座,沉浸式学习深度学习、强化学习、机器学习、计算机视觉和自然语言处理!!

12k
3k
732
+9
排名 #4
7月20日
查看详情

abus-aikorea/voice-pro

为创作者和开发者打造的Gradio WebUI,具备核心TTS功能(Edge-TTS、kokoro)和零样本声音克隆(E2与F5-TTS、CosyVoice),并集成Whisper音频处理、YouTube下载、Demucs人声分离和多语言翻译。

12k
1.7k
666
+46
排名 #11
8月3日
查看详情

openvinotoolkit/openvino

OpenVINO™是用于优化和部署AI推理的开源工具套件

10k
3.4k
1.7k
+6
排名 #8
9月19日
查看详情

QwenAudio/SenseVoice

开源 SenseVoiceSmall 模型,适用于普通话、粤语、英语、日语和韩语 ASR、语言 ID、情绪识别和音频事件检测。

9.3k
821
454
+74
排名 #11
9月6日
查看详情

Blaizzy/mlx-audio

基于 Apple MLX 框架构建的文本转语音 (TTS)、语音转文本 (STT) 和语音转语音 (STS) 库,可在 Apple Silicon 上提供高效的语音分析。

7.8k
689
1.1k
+12
排名 #15
8月17日
查看详情

argmaxinc/argmax-oss-swift

面向苹果芯片的端侧语音人工智能

6.3k
596
870
+2
排名 #8
8月16日
查看详情

fikrikarim/parlor

设备端实时多模态AI。与完全运行在您本机上的AI进行自然的语音和视觉对话,由Gemma 4 E2B和Kokoro驱动。

1.9k
232
721
+3
排名 #9
7月4日
查看详情

matthiasn/lotti

开源私人日志本,内置本地智能代理层。长期运行的 AI 代理会读取你的记录并建议下一步行动。在硬件允许的情况下,模型也可在本地运行。采用 Matrix 与 Vodozemac 实现设备间的端到端加密同步。

1.1k
111
766
+1
排名 #14
6月27日
查看详情

soniqo/speech-swift

面向 Apple Silicon 的 AI 语音工具包 — 基于 MLX 和 CoreML 的 ASR、TTS、语音到语音、VAD 及说话人分离功能。

977
122
754
+13
排名 #4
7月4日
查看详情

sgl-project/sglang-omni

SGLang-Omni 为 TTS、ASR、语音和全向模型提供高性能服务。

819
341
489
+12
排名 #10
8月15日
查看详情

CrispStrobe/CrispASR

面向多语言ASR与TTS模型的C++ ggml运行时中心:支持Cohere Transcribe、Parakeet TDT、Voxtral、Canary 1B v2等,并集成通用强制对齐等功能

450
70
570
+7
排名 #20
7月17日
查看详情

FluidInference/FluidAudio

在您的应用中集成前沿CoreML音频模型——文本转语音、语音转文本、语音活动检测及说话人分离。基于Swift开发,由顶尖开源技术驱动。

0
0
929
排名 #12
9月12日
查看详情
助手