"Always-On" Deepseek AI Assistant: Aufbau eines intelligenten Sprachinteraktionssystems auf Basis von Deepseek-V3综合介绍 Always-On AI Assistant是一个创新的AI助手项目,它通过整合Deepseek-V3、RealtimeSTT和Typer等先进技术,打造了一个功能强大的永久在线AI助理系统...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 5 Monaten01.7K0
Xiaozhi AI Chatbot: Erstellen Sie Ihren AI-Chatbot-Begleiter, einfacher Sprachdialog und intelligente Interaktion综合介绍 小智 AI 聊天机器人是一个基于ESP32开发板的开源项目,旨在帮助用户构建自己的AI聊天伴侣。该项目由虾哥开发,主要用于教学目的,帮助更多人入门AI硬件开发,并了解如何将大语言模型应用到实...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 3 Monaten01.5K0
Ichigo (llama3-s): lokaler Echtzeit-Sprachassistent, Open-Source-Version von Siri综合介绍 Ichigo是一个开源的实时语音AI项目,旨在扩展基于文本的语言模型,使其具备原生的“听力”能力。该项目采用了早期融合技术,灵感来自Meta的Chameleon论文。Ichigo的目标是成为...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 5 Monaten01.3K0
VITA: Open Source Multimodale Großsprachmodelle für visuelle und sprachliche Interaktion in Echtzeit综合介绍 VITA是一个领先的开源交互式多模态大语言模型项目,率先实现了真正的全方位多模态交互能力。该项目于2024年8月推出VITA-1.0版本,开创了首个开源交互式全模态大语言模型的先河。2024...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 5 Monaten01.2K0
Bailing: ein quelloffener Sprachdialogassistent mit niedriger Latenz für natürliche Konversation und Kommunikation综合介绍 百聆(Bailing)是一个开源的语音对话助手,旨在通过语音与用户进行自然的对话。该项目结合了语音识别(ASR)、语音活动检测(VAD)、大语言模型(LLM)和语音合成(TTS)技术,实现了...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 4 Monaten01K0
Fish Agent: End-to-End-KI-Stimmenklon-Assistent, Echtzeit-Sprachdialog-Assistent, Fish Speech-Spin-off-Projekt综合介绍 Fish Speech 衍生项目 Fish Agent 是一款革命性的端到端AI语音克隆系统,基于V0.1 3B模型架构开发。作为一个完全端到端的语音克隆处理系统,其最大特点是采用创新的无语...Neueste AI-Tools# AI Java Open Source Projekt# AI-Stimmenklonen# Multimodale interaktive Echtzeit-Produktevor 5 Monaten01K0
OpenAI Realtime Agents: Eine multiintelligente Körper-Sprach-Interaktions-Anwendung (OpenAI-Beispiel)综合介绍 OpenAI Realtime Agents是一个开源项目,旨在展示如何利用OpenAI的实时API来构建多智能体的语音应用。它提供了高级的智能体模式(借鉴 OpenAI Swarm),允许...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 4 Monaten01K0
BrownChat: quelloffener Echtzeit-Sprachchat-KI-Assistent综合介绍 BrownChat 是一个基于大型语言模型(LLM)技术的实时音频聊天应用。该项目由 GitHub 用户 sugarforever 开发,旨在通过先进的自然语言处理技术提升用户的沟通体验。B...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 5 Monaten01K0
Weebo: ein Echtzeit-Sprach-Chatbot, der einen Dialog in natürlicher Sprache ermöglicht综合介绍 Weebo 是一个开源的实时语音聊天机器人,利用 Whisper Small 进行语音识别,Llama 3.2 进行自然语言生成,以及 Kokoro-82M 进行语音合成。该项目由 Aman...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 5 Monaten01K0
OpenAI Realtime API Next.js: eine Next.js-Vorlage für die Entwicklung von Echtzeit-KI-Anwendungen mit Sprachdialog综合介绍 OpenAI Realtime API Next.js 是一个基于Next.js框架的开源项目,旨在帮助开发者快速构建实时语音AI应用。该项目集成了OpenAI的实时API和WebRTC技术...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 5 Monaten01K0
DeepSeek-VL2: ein visuelles Experten-Sprachmodell für fortgeschrittenes multimodales Verstehen综合介绍 DeepSeek-VL2 是一系列高级的 Mixture-of-Experts (MoE) 视觉语言模型,显著提升了其前身 DeepSeek-VL 的性能。该模型在视觉问答、光学字符识别、文...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 4 Monaten09830
TransRouter: ein Echtzeit-Audio-Konvertierungstool für die Übersetzung vom Chinesischen ins Englische auf der Grundlage des multimodalen Gemini-Modells综合介绍 TransRouter 是一个基于 Google Gemini 大模型的实时语音翻译工具,专门设计用于实现中英文之间的实时语音互译。该工具能够无缝集成到 Zoom 等视频会议软件中,为跨语言...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 5 Monaten09420
Megrez-3B-Omni: ein Modell für multimodales Verstehen auf der Endseite, das multimodales Verstehen und Analysieren von Text, Bild und Audio unterstützt综合介绍 Infini-Megrez是由无问芯穹(Infinigence AI)开发的边缘智能解决方案,旨在通过软硬件协同设计,实现高效的多模态理解和分析。该项目的核心是Megrez-3B模型,支持图...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 4 Monaten09360
AI Web Operator: Browser-Automatisierung, Open-Source-Implementierung von OpenAI Operator综合介绍 AI Web Operator 是一个开源的 AI 浏览器操作工具,旨在通过集成多种 AI 技术和 SDK,简化用户在浏览器中的操作体验。该工具基于 Browserbase 和 Vercel...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 4 Monaten09130
OmAgent: ein intelligenter Körperrahmen für den Aufbau multimodaler intelligenter Geräte综合介绍 OmAgent是由Om AI Lab开发的一个多模态智能体框架,旨在为智能设备提供强大的AI驱动功能。该项目通过整合最先进的多模态基础模型和智能体算法,使开发者能够在各种智能设备上创建高效...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produkte# Entwicklungsrahmen für intelligente Körpervor 5 Monaten08640
Step-Audio: ein multimodales Sprachinteraktionssystem, das u. a. Sprache erkennt und mit geklonter Sprache kommuniziert综合介绍 Step-Audio 是一个开源的智能语音交互框架,旨在提供生产环境开箱即用的语音理解和生成能力。该框架支持多语言对话(如中文、英文、日语)、情感语音(如快乐、悲伤)、区域方言(如粤语、四川...Neueste AI-Tools# AI Java Open Source Projekt# AI-Stimmenklonen# Multimodale interaktive Echtzeit-Produktevor 3 Monaten08280
PowerAgents: Intelligente KI-Plattform für die zeitgesteuerte Ausführung von Webaufgaben综合介绍 PowerAgents 是一个专注于网页自动化任务的AI智能体平台,用户可以通过它创建并部署能够点击、输入和提取数据的AI智能体。该平台支持将任务设置为按小时、天或周自动运行,用户还能实时观...Neueste AI-Tools# Multimodale interaktive Echtzeit-Produktevor 3 Monaten08240
SpeechGPT 2.0-Preview: ein durchgängiges anthropomorphes Sprachdialog-Makromodell für Echtzeit-Interaktion综合介绍 SpeechGPT 2.0-preview 是 OpenMOSS 推出的首个拟人化实时交互系统,基于百万小时级语音数据训练而成。该系统具备拟人口语化表达与百毫秒级低延迟响应,支持自然流畅的实...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 4 Monaten08170
Qwen2.5-Omni: ein Endmessungsmodell für multimodale Eingabe und Sprachinteraktion in Echtzeit综合介绍 Qwen2.5-Omni 是阿里巴巴云 Qwen 团队开发的一款开源多模态 AI 模型。它能处理文本、图像、音频和视频等多种输入,并实时生成文本或自然语音响应。这款模型于 2025 年 3 ...Neueste AI-Tools# AI Java Open Source Projekt# Multimodale interaktive Echtzeit-Produktevor 2 Monaten07700