阿里云发布多模态交互开发套件,让硬件能听、会看、会交互
创始人
2026-01-08 18:41:03

1月8日,在阿里云通义智能硬件展上,阿里云发布多模态交互开发套件,该套件集成了千问、万相、百聆三款通义基础大模型,并预置十多款生活休闲、工作效率等领域的Agent和MCP工具,不仅能听、会看,还能思考并且与物理世界交互,可应用于AI眼镜、学习机、陪伴玩具、智能机器人等硬件设备。

随着多模态大模型的发展,大模型已开始具备理解、感知以及和物理世界交互的能力,越来越多的硬件和终端设备厂商开始通过接入大模型来提升交互体验。然而,仅靠基础大模型仍无法同时满足硬件设备对低成本、低时延、功能丰富和高质量效果的需求。

阿里云多模态交互开发套件为硬件企业和解决方案商提供了低开发门槛、响应速度快、场景丰富的平台。在芯片层面,该套件适配了30多款主流ARM、RISC-V和MIPS架构终端芯片平台,满足市面上绝大多数硬件设备的快速接入需求。未来,通义大模型还将与玄铁RISC-V实现软硬全链路的协同优化,实现通义大模型家族在RISC-V架构上的极致高效部署和推理性能。

在模型优化层面,除通义模型家族外,阿里云还针对大量多模态交互场景进行分析,推出适合AI硬件交互的专有模型,全面支持全双工语音、视频、图文等交互方式,端到端语音交互时延低至1秒,视频交互时延低至1.5秒。

此外,该套件预置十多款MCP工具和Agent,覆盖生活、工作、娱乐、教育等多个场景,例如,基于预置的出行规划Agent,用户可直接调用路线规划、旅行攻略、吃喝玩乐探索等能力。该套件还接入了阿里云百炼平台生态,用户不仅可以添加其他开发者提供的MCP和Agent模板,还能通过 A2A协议兼容三方Agent,极大程度地扩展了应用的能力边界,帮助企业灵活搭建业务场景。

现场,阿里云还展示了面向智能穿戴设备、陪伴机器人、具身智能等领域的解决方案。例如,在AI眼镜领域,基于千问VL、百聆CosyVoice等模型,阿里云打造了感知层、规划层、执行层以及长期记忆的完整交互链路,可一站式实现同声传译、拍照翻译、多模态备忘录、录音转写功能,有效解决交互不自然、回答准确率低的难题。面向家庭陪伴机器人场景,基于千问模型和多模态交互套件,阿里云推出的解决方案不仅可实时监测异常状况,并及时告警信息推送,用户还能基于关键词查找、定位视频,与机器人进行对话交互和控制设备等。

根据国际权威市场研究机构Gartner发布的GenAI(生成式AI)技术创新指南系列报告,阿里云在GenAI云基础设施、GenAI工程、GenAI模型以及AI知识管理应用四大维度均位于新兴领导者象限,为入选全部四项新兴领导者象限的唯一亚太厂商,并比肩谷歌、OpenAI。

⚠️
本网站信息内容及素材来源于网络采集或用户发布,如涉及侵权,请及时联系我们,发送链接至2697952338@QQ.COM,我们将第一时间进行核实与删除处理。

相关内容

热门资讯

未来之星计划秦峰老师推荐战略进... 本文旨在进行投资风险教育,不针对任何特定企业。以下案例为拟情景,如有雷同纯属巧合。​ 什么是原始股?...
厦门兆赫视界新媒体旅游项目投资... 本文旨在进行投资风险教育,不针对任何特定企业。以下案例为拟情景,如有雷同纯属巧合。某国企背书的旅游项...
方舟商学院常红老师、林邵一院长... 追损是个系统工程,如果你正苦于不知如何着手挽回损失,或者担心自己处理不好,可以添加锐明法律微信随时在...
陕西三八妇乐股权投资能信吗?靠... 本文旨在进行投资风险教育,不针对任何特定企业。以下案例为拟情景,如有雷同纯属巧合。什么是原始股投资?...
天相财富交vip服务费可以退吗... 北.京天相财富管理顾问有限公司以下简称“天相投顾”,旗下的“股多多”股票软件怎么样?在天相投顾业务员...
方舟商学院林邵林院长战略配售华... 本文旨在进行投资风险教育,不针对任何特定企业。以下案例为其他类似股权情景,如有雷同纯属巧合。随着生活...
深圳市同聚富投资服务合伙企业(... 在投资市场中,不少股民会遇到“购买拟上市公司份额即可获得原始股”的邀约,这类通过公开认购拉投资的行为...
未来之星计划秦峰老师直播间摇号... 本文旨在进行投资风险教育,不针对任何特定企业。以下案例为拟情景,如有雷同纯属巧合。什么是原始股投资?...
灯塔互联直播间推荐南京中科微点... 本文旨在进行投资风险教育,不针对任何特定企业。以下案例为拟情景,如有雷同纯属巧合!近年来,以“原始股...
小鹅直播间灯塔驿站旭东直播间南... 本文旨在进行投资风险教育,不针对任何特定企业。以下案例为拟情景,如有雷同纯属巧合。 最近,总有人问:...