由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
multimodal
话题找到数量
Mintplex-Labs/anything-llm
内置RAG、AI智能体、无代码智能体构建器、MCP兼容等功能的桌面与Docker一体化AI应用
modelscope/ms-swift
使用PEFT或全参数方法对500余个大语言模型和200余个多模态大语言模型进行CPT/SFT/DPO/GRPO训练
Blaizzy/mlx-audio
基于 Apple MLX 框架构建的文本转语音 (TTS)、语音转文本 (STT) 和语音转语音 (STS) 库,可在 Apple Silicon 上提供高效的语音分析。
genkit-ai/genkit
用于在JavaScript、Go和Python中构建AI驱动的应用程序的开源框架,由Google构建并在生产环境中使用
microsoft/PhiCookBook
这是一本 Phi 系列 SLM 书籍,用于入门 Phi 模型。 Phi 是微软开发的一系列开源人工智能模型。 Phi 模型是现有功能最强大、最具成本效益的小语言模型 (SLM),在各种语言、推理、编码和数学基准测试中,其性能优于相同大小和更高大小的模型
liustack/modlens
DeepSeek Harness 的第一个视觉插件,以及每个纯文本编码代理的视觉桥。粘贴图像,获取结构化 JSON 证据(OCR、布局、语义)。 | 全网第一个 DeepSeek Harness 视觉插件,为 DeepSeek、GLM 等纯文本模型外挂视觉能力,粘贴图片即得格式化 JSON 证据(OCR、版面、语义)。
OpenMOSS/MOSS-TTS
MOSS‑TTS 系列是由 MOSI.AI 与 OpenMOSS 团队开发的开源语音与声音生成模型系列。
Tencent-Hunyuan/HunyuanImage-3.0
HunyuanImage-3.0:一个强大的原生多模态图像生成模型
fikrikarim/parlor
设备端实时多模态AI。与完全运行在您本机上的AI进行自然的语音和视觉对话,由Gemma 4 E2B和Kokoro驱动。
jordanrendric/claude-video-vision
让 Claude 能够观看和理解视频 — 具有帧提取和多模态音频分析功能的 Claude Code 插件
yashab-cyber/opendroid
您的开放式自治 Android 代理 — 一款可投入生产、自我规划的 AI 助手,由本地/远程 LLM 和可访问性驱动的屏幕自动化提供支持。