阿里云推出多模态交互开发套件，助力硬件实现听、看与交互功能[图]

2026-02-10 15:08:10

字体大小：【小 | 中 | 大】

1月8日举办的阿里云通义智能硬件展上，阿里云推出了多模态交互开发套件。这款套件整合了千问、万相、百聆三款通义基础大模型，同时预先配置了十多款覆盖生活休闲、工作效率等领域的Agent和MCP工具。它具备听、看、思考的能力，还能与物理世界进行交互，可适配于AI眼镜、学习机、陪伴玩具、智能机器人等各类硬件设备。

随着多模态大模型的持续演进，这类模型已逐步拥有理解、感知并与物理世界进行交互的能力，越来越多的硬件及终端设备厂商正尝试接入大模型以优化产品的交互体验。不过，单纯依赖基础大模型，依旧难以同时满足硬件设备在低成本、低时延、功能多样性与高质量效果等方面的综合需求。

阿里云多模态交互开发套件面向硬件企业与解决方案商，打造了一个开发门槛低、响应速度快且场景丰富的服务平台。在芯片适配方面，该套件已兼容30余款主流的ARM、RISC-V及MIPS架构终端芯片平台，能够满足市面上绝大多数硬件设备的快速接入需求。未来，通义大模型还将与玄铁RISC-V展开软硬全链路的协同优化工作，以实现通义大模型家族在RISC-V架构上的极致高效部署与推理性能。

在模型优化方面，除了通义模型家族，阿里云还对众多多模态交互场景展开分析，推出适配AI硬件交互的专属模型，全方位支持全双工语音、视频、图文等交互形式，端到端语音交互时延可低至1秒，视频交互时延则低至1.5秒。

此外，该套件预先配置了十多款MCP工具与Agent，涵盖生活、工作、娱乐、教育等诸多场景。举例而言，借助预置的出行规划Agent，用户能够直接调用路线规划、旅行攻略、吃喝玩乐探索等功能。同时，该套件还接入了阿里云百炼平台生态，用户不仅可以添加其他开发者提供的MCP和Agent模板，还能通过A2A协议兼容第三方Agent，这在很大程度上拓展了应用的能力范围，助力企业灵活构建业务场景。

在活动现场，阿里云也呈现了针对智能穿戴设备、陪伴机器人、具身智能等领域的解决方案。以AI眼镜领域为例，依托千问VL、百聆CosyVoice等模型，阿里云构建起包含感知层、规划层、执行层以及长期记忆的完整交互链路，能够一站式达成同声传译、拍照翻译、多模态备忘录、录音转写等功能，切实交互不自然、回答准确率低的难题。而在家庭陪伴机器人场景方面，基于千问模型与多模态交互套件，阿里云推出的解决方案不仅可以实时监测异常状况并及时推送告警信息，用户还能通过关键词查找、定位视频，和机器人进行对话交互以及控制设备等操作。

根据国际权威市场研究机构Gartner发布的生成式AI（GenAI）技术创新指南系列报告，阿里云在GenAI云基础设施、GenAI工程、GenAI模型以及AI知识管理应用这四大维度，均处于新兴领导者象限。值得一提的是，阿里云是唯一一家在全部四项中都入选新兴领导者象限的亚太厂商，并且与谷歌、OpenAI处于同一行列。

上一篇：泰国电竞丑闻女主入选国家队的原因被曝光！连线下集训都不参加[多图]

下一篇：台湾情侣在列车上公然亲热，这究竟是想做什么啊！[多图]

阿里云推出多模态交互开发套件，助力硬件实现听、看与交互功能[图]

最新文章热门文章

最新游戏热门游戏