IT之家 8 月 4 日消息,技术媒体 TestingCatalog 于 8 月 2 日发布博文,报道称微软正测试其首款原生实时语音模型 MAI Realtime,支持 16 种语言、2 种语音,可在对话中听说并行,支持自动识别和中途切换语言。 科技新闻。
测试方面,消息称微软已邀请部分合作伙伴,在 MAI Playground 平台测试该模型,目前尚不清楚何时上线 Microsoft Foundry,以及扩展到 Copilot 语音功能上。
英语
AI背景与起因
中文
韩语
土耳其语
AI事件经过
印度尼西亚语
俄语
运行方面,MAI Realtime 采用双向、全双工交互方式,无需严格按“用户说完、模型再答”的轮次交替,可支持同步聆听和回应。
AI各方回应
泰语
意大利语
在支持语言方面,MAI Realtime 模型支持中文等在内 16 种语言,IT之家援引博文介绍,附上相关支持的语言如下:
AI影响分析
越南语
在语音风格方面,消息称该模型测试提供 Victoria 和 Grant 两种语音,比 Copilot 目前的语音模式更加自然。用户可以主动地指定语言,也可以启用自动检测。
日语
该模型不支持唱歌或生成非语音音效,定位仍是对话系统。调试面板可显示实时延迟、模型思考内容和处理步骤,样本分享功能或将在测试权限扩大后向平台用户开放。
德语
阿拉伯语
西班牙语
葡萄牙语
印地语
微软此前发布的 MAI 语音模型均为单向模型,包括用于语音合成的 MAI-Voice-2 及其 Flash 版本,以及用于语音识别的 MAI-Transcribe-1.5。
荷兰语
法语
IT之家注:全双工语音(Full-duplex voice)指系统可在同一时间接收用户语音并输出回复,不必等待一方完全说完。它依靠端点检测识别说话开始、停顿和结束,也需要在用户插话时调整输出。
广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。