
手机正在变得越来越像机器人。
8月12日,荣耀在广州发布全球首款机器人手机Robot Phone,售价9999元起。与过去手机厂商给产品增加一个AI助手、一个大模型功能不同,荣耀这一次直接从手机的形态和交互方式入手:在一部传统智能手机里加入四自由度钛合金灵巧云台,让摄像头具备主动运动能力;再以Agentic OS为底层,构建系统级Agent,让AI能够理解用户意图并调用系统能力完成任务;同时与百年电影工业品牌ARRI深度合作,将专业电影影像能力带进移动终端。
如果把这三个变化放在一起看,Robot Phone真正想做的并不是一部“会转的手机”,而是让手机第一次具备更明显的机器人属性:有可以主动运动的机械结构,有能够自主决策和执行任务的系统级AI Agent,还有能够感知现实世界的多模态能力。
这也是荣耀所谓“多模态具身交互”的核心。
过去的AI手机,本质上还是一个数字终端。AI可以在屏幕里聊天、搜索、生成内容,却很难真正改变手机与现实世界之间的关系。Robot Phone试图做的,则是让AI开始通过摄像头、麦克风、云台和系统能力感知现实环境,再根据用户意图作出判断并执行动作。
手机由此开始从“被动响应”走向“主动交互”。
机器人云台,让手机获得主动运动能力
智能手机并不是第一次使用云台。
过去手机厂商也做过微云台、防抖云台以及各种机械稳定结构,主要目的是提高拍照和视频拍摄的稳定性。荣耀Robot Phone的不同之处,在于它没有把云台仅仅当成一种影像防抖机构,而是把它进一步设计成了手机与现实世界交互的机械执行机构。
荣耀为Robot Phone打造了一套四自由度钛合金灵巧云台。

这套结构拥有100余个精密零件,涉及60余项精密工艺,官方公布的加工精度达到±0.005mm,整体尺寸相比原有方案缩小65%。其中云台电机重量仅2.6g,三轴最大控制转速达到360°/s,并配备自研盾构钢翻转电机,扭矩密度达到120N·m/L。

这些参数最终指向的并不是“云台有多厉害”这么简单,而是一个更重要的变化:手机上的摄像头开始能够主动改变自己的姿态。
普通手机的摄像头固定在机身上,用户移动,摄像头跟着移动;用户想换一个角度,就必须自己拿着手机调整。
Robot Phone则试图把一部分动作交给手机自己完成。

例如视频通话时,手机可以自动追踪人物;直播时,可以利用云台进行自动追焦;拍摄时,用户只需要告诉YOYO想拍什么,系统可以根据人物和环境调整角度和构图。
这意味着摄像头不再只是一个“眼睛”,云台则成为这个“眼睛”的运动机构。
而当机械结构能够被AI直接调用,它的意义就发生了变化。
过去手机里的AI最多可以告诉用户“应该怎么拍”,现在它开始具备“替用户完成拍摄动作”的可能。
这正是Robot Phone与普通AI手机之间的一道分界线。
系统级Agent,让AI从“助手”变成手机的执行者
如果说机器人云台给手机增加的是“行动能力”,那么系统级Agent解决的就是另外一个问题:谁来决定什么时候行动,以及应该怎么行动。
这也是Robot Phone最值得关注的部分。
荣耀在这款产品上推出Agentic OS,并以系统级Agent架构为基础,首发YOYO Pro机器人模式。与传统AI助手最大的区别在于,YOYO并不是一个被单独放在系统里的聊天入口,而是试图成为能够调用操作系统和应用能力的执行层。

这意味着,AI的角色开始发生变化。
过去用户使用手机,基本遵循的是“人找功能”的逻辑:先打开某个App,再找到相应功能,最后一步一步完成操作。
系统级Agent则试图反过来,让用户只描述最终目标,AI负责理解任务、规划步骤,并调用不同的应用和系统能力完成任务。

例如一个复杂任务可能同时涉及搜索、整理信息、调用应用、填写内容以及最终提交。传统语音助手往往只能完成其中一两个动作,而系统级Agent需要做的是理解完整任务,并把多个动作串起来。

荣耀将这种能力概括为“超长任务一句话搞定,跨越生态一句话联动”。
真正值得注意的是,这种能力如果能够稳定运行,改变的不只是一个AI助手,而是手机的操作方式。
App仍然存在,但用户不再需要围绕App组织自己的操作。
这可能是Agent时代手机操作系统最重要的一次变化。
荣耀还与阿里巴巴千问大模型展开深度共创,推出面向手机场景优化的终端大模型解决方案。大模型负责理解和推理,系统级Agent负责调度,手机自身的系统能力和第三方应用则成为可以被调用的工具。

这实际上形成了一套新的手机AI架构:
大模型负责“想”,Agent负责“规划和调用”,系统能力负责“执行”。
而Robot Phone进一步加入了机械云台、摄像头、麦克风等现实世界接口,于是AI不再只能操作数字世界中的App,还开始拥有操作物理终端的能力。
这才是“机器人手机”真正成立的关键。

多模态Agent,不只是听懂一句话
如果系统级Agent解决的是“执行”,那么多模态能力解决的就是“理解”。
荣耀为Robot Phone打造了多模态具身感知系统,YOYO不仅能够理解文字和语音,还可以结合视觉、手势、人物状态以及环境信息进行交互。
例如用户指向某个方向,YOYO可以理解“你所指”的对象;在拍照过程中,它能够识别人物和环境,并据此进行构图和姿势推荐。
这种交互方式与传统语音助手存在明显区别。
传统助手需要用户把需求转换成一句标准的指令:“打开相机”“切换前置摄像头”“拍摄视频”。
而多模态Agent希望让用户用更加自然的方式与手机交流。你可以说,也可以指,可以移动,也可以直接把手机面对一个场景,让AI自己理解发生了什么。
这就是“多模态具身交互”这个概念真正有价值的地方。
AI不再只理解用户说了什么,而开始理解用户正在做什么、看什么,以及周围正在发生什么。
再加上能够主动转动的云台,手机的感知范围也从一个固定摄像头变成了可以主动调整视角的“移动视觉系统”。
当然,Robot Phone目前的“具身”能力仍然非常有限,它并不是一台真正意义上的机器人。它不会走路,也不能像人形机器人一样抓取和操作复杂物体。
但它做了一件此前手机很少真正做到的事情:把AI的数字决策能力与手机的物理运动能力连接起来。

这是一个很重要的区别。
从“帮你拍”到“自己完成运镜”
影像则是Robot Phone目前最容易让普通用户感知到的应用场景。
荣耀与ARRI展开深度合作,把电影工业中的色彩、影调和专业工作流引入手机。
Robot Phone支持ARRI LogC3曲线、ARRI Wide Gamut 3色域、10bit Log和4:2:2采样,并内置11种ARRI Looks,同时提供专属ARRI电影模式,包括伪色监看、峰值对焦以及2.39:1电影画幅等功能。
硬件方面,它采用2亿像素灵巧云台主摄,配备1/1.28英寸传感器和f/1.6大光圈,支持最高4倍无损变焦,并通过三轴机械防抖云台提供六种运镜模式。

这里真正有意思的是,ARRI影像和机器人云台并不是两个完全独立的卖点。
过去手机影像的竞争,很大程度上是在比拼传感器、镜头、算法和计算摄影;而Robot Phone进一步增加了一个变量:手机自己能够运动。
如果再叠加AI Agent,整个拍摄流程就可能变成:
用户提出拍摄意图,AI理解场景和人物,系统规划拍摄方式,云台执行运动,摄像头完成记录,最后再由AI完成相应的影像处理。
这已经不是简单的“AI帮你修图”,而是AI开始介入整个拍摄过程。

荣耀推出的“灵感帮拍”正是在做这件事情。AI可以识别主体、推荐姿势,并通过云台自动完成构图;在直播场景中,云台可以自动追焦;视频通话时,则可以自动跟随人物移动。
以前,一个人想拍出复杂的运动镜头,往往需要摄影师、稳定器甚至专业设备配合。Robot Phone试图把其中的一部分能力压缩到手机自身。
所以,ARRI解决的是“拍得像电影”,云台解决的是“怎么运动”,AI Agent则解决的是“什么时候动、往哪里动”。
三者组合起来,才构成了Robot Phone的完整产品逻辑。
9999元起,荣耀真正押注的是下一代AI终端
Robot Phone售价9999元起,12GB+512GB版本售价9999元,16GB+1TB版本售价12999元。
这个价格注定它暂时不会成为一款大众型产品。

更重要的是,机器人手机还需要面对很多现实问题。机械结构越复杂,对可靠性、耐久性和维修体系的要求就越高;系统级Agent越深入系统,用户对准确率、稳定性和隐私安全的要求也越高。
尤其是Agent。
让AI回答问题并不难,真正困难的是让AI长期稳定地替用户完成复杂任务。一次任务执行成功,并不意味着系统级Agent已经成熟。只有当它能够在不同App、不同场景和不同任务中保持可靠执行,用户才会真正愿意把手机操作权交给AI。
所以,Robot Phone真正值得观察的,并不是它能不能让云台转起来,而是机械能力和Agent能力能否形成稳定的闭环。
如果未来AI能够理解用户意图,通过多模态感知理解现实环境,再调用手机的机械结构和各种系统能力主动完成任务,那么手机的角色确实可能发生变化。
它不再只是一个等待人操作的终端,而开始成为一个能够主动感知、理解和执行的个人智能设备。
这也是荣耀提出“多模态具身交互”的真正含义。
从这个角度看,Robot Phone更像是一次对未来手机形态的提前下注。
机器人云台让手机获得了机器人式的运动能力,系统级Agent让AI获得了自主执行能力,多模态感知让AI能够理解现实环境,而ARRI影像则提供了目前最直接、最成熟的应用场景。
这四件事情叠加起来,才让“机器人手机”不再只是一个听起来新鲜的产品名称。
当然,它能否成为下一代手机的真正方向,现在还远没有答案。
但至少从8月12日开始,手机行业出现了一种新的想象:未来的手机可能不只是屏幕更大、芯片更快、摄像头更多,而是会主动转向你、理解你正在做什么,并替你完成原本需要自己操作的事情。
当AI开始拥有运动能力,手机也就第一次真正靠近了“机器人”。

评论交流