6.8
深览指数
产品腾讯新闻·AGIHunt··AI 生成

阿里发布了一个用嘴和 AI 对话的神器

作者以自身技术实践(开源麦克风方案、Peeky项目)切入,介绍阿里新发布的Qoder Voice:一款全双工语音AI助手,能与用户实时对话并操控电脑。文章通过多个工作场景(终端配置、软件指导、资料整理、雅思陪练)展示了其核心能力:屏幕感知、随时打断、边干活边汇报。作者认为,相较于单向语音输入,Qoder Voice实现了人与Agent之间更自然的协作模式,核心技术是阿里自研的Qwen-Audio-3.0-Realtime模型。适合对AI Agent、语音交互、开发者工具有兴趣的读者阅读。原文 ↗

核心观点
  • Qoder Voice 的核心价值在于其全双工+屏幕感知能力,实现了人与 Agent 之间自然的、可打断的协作模式,而非单向的语音指令输入。
  • 语音应该是 AI 交互的下一个效率瓶颈,当语音识别足够成熟时,键盘输入成为了信息吞吐的瓶颈,而 Qoder Voice 是解决这一瓶颈的产品化尝试。
  1. 01作者在 GPT 刚发布后即用树莓派实现语音对话,后开源了200元大疆麦克风方案,并在日常工作中团队人手一个麦克风对着电脑说话。
  2. 02Qoder Voice 支持全双工模式,用户可在 AI 说话时打断,AI 也能在干活时主动汇报进展或寻求帮助。
  3. 03Qoder Voice 经授权后可查看用户屏幕,作者在 ScreenFlow 软件使用指导的场景中,AI 能准确指出用户选中的是音频片段导致裁剪控件灰色,并给出正确操作建议。
  4. 04Qoder Voice 可以自己操作自己的界面,在作者询问如何安装插件时,它直接操控鼠标和键盘打开了 MarketPlace 并完成安装路径演示。
  5. 05Qoder Voice 后端由阿里 Qwen-Audio-3.0-Realtime 模型驱动,该模型在 Artificial Analysis 的 Speech to Speech 榜单上综合得分 84.1%,排名全球第一。
反方 / 局限
  • 当前 Qoder Voice 还存在一些不足:音色固定不能切换、说话情绪偏中性、对背景音屏蔽能力不足、不支持多 session 并行工作、屏幕隐私保护机制有待完善。
15 分钟 · 5 卡片 · 13 资料
读原文 →

概念锚点

前置背景

平行视角

未来推演

延伸追问