由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名

asr

话题找到数量

modelscope/FunASR

端到端语音识别基础工具包与开源SOTA预训练模型,支持语音识别、语音活动检测、文本后处理等功能。

18k
1.9k
1.3k
+2.1k
排名 #14
6月30日
查看详情

NVIDIA-NeMo/Speech

一个可扩展的生成式 AI 框架,专为从事大语言模型、多模态及语音 AI(自动语音识别与文本转语音)的研究人员和开发者构建。

18k
3.6k
1.1k
+42
排名 #17
8月24日
查看详情

NVIDIA-NeMo/NeMo

专为从事大语言模型、多模态和语音人工智能(自动语音识别与文本转语音)的研究人员和开发者打造的可扩展生成式AI框架

17k
3.4k
1.6k
+9
排名 #22
6月12日
查看详情

alphacep/vosk-api

适用于Android、iOS、树莓派及服务端的离线语音识别API,支持Python、Java、C#和Node.js开发语言。

15k
1.8k
1k
+27
排名 #16
9月6日
查看详情

k2-fsa/sherpa-onnx

基于新一代Kaldi与onnxruntime的离线语音转文字、文字转语音、说话人日志、语音增强、源分离及语音活动检测技术。支持嵌入式系统、Android、iOS、HarmonyOS、树莓派、RISC-V架构、x86_64服务器、WebSocket服务端/客户端,兼容12种编程语言。

14k
1.7k
1.3k
+19
排名 #11
9月18日
查看详情

QwenAudio/SenseVoice

开源 SenseVoiceSmall 模型,适用于普通话、粤语、英语、日语和韩语 ASR、语言 ID、情绪识别和音频事件检测。

9.3k
821
458
+74
排名 #11
9月6日
查看详情

umlx5h/LLPlayer

专为语言学习打造的媒体播放器,具备双语字幕、AI生成字幕、实时翻译等功能!

4.2k
246
1k
+9
排名 #2
9月19日
查看详情

0xShug0/audio.cpp

一款用于音频模型的一体化纯 C++ 推理引擎,由 ggml 提供支持。支持TTS、STT、VAD、语音转换、音乐生成等,性能高度优化。没有 Python 依赖。

2.8k
315
202
+396
排名 #4
9月16日
查看详情

handy-computer/transcribe.cpp

支持16+模型家族的ggml语音转文本推理

1.7k
68
610
+9
排名 #15
8月1日
查看详情

meizhong986/WhisperJAV

ASR/STT字幕生成器。采用Qwen3-ASR、本地LLM、Whisper、TEN-VAD技术,具备针对JAV场景的噪声鲁棒性

1.2k
112
893
+103
排名 #7
3月15日
查看详情

soniqo/speech-swift

面向 Apple Silicon 的 AI 语音工具包 — 基于 MLX 和 CoreML 的 ASR、TTS、语音到语音、VAD 及说话人分离功能。

977
122
756
+13
排名 #4
7月4日
查看详情

sgl-project/sglang-omni

SGLang-Omni 为 TTS、ASR、语音和全向模型提供高性能服务。

819
341
490
+12
排名 #10
8月15日
查看详情

amicalhq/amical

🎙️ AI Dictation App - Open Source and Local-first ⚡ Type 3x faster, no keyboard needed. 🆓 Powered by open source models, works offline, fast and accurate.

773
74
900
+8
排名 #6
2月15日
查看详情

FluidInference/FluidAudio

在您的应用中集成前沿CoreML音频模型——文本转语音、语音转文本、语音活动检测及说话人分离。基于Swift开发,由顶尖开源技术驱动。

0
0
935
排名 #12
9月12日
查看详情
助手