【ZOL中关村在线原创技术解析】无论是影视剧还是游戏,人们对AI的想象都有一些共同点。大家往往不会关心它用了什么芯片、有多少内存,更在意它能不能听懂人的需求,又能帮人做到什么。放在手机上也是如此,随着AI开始参与越来越多的操作,过去很容易被用户感知的硬件参数,也开始慢慢退到体验背后。
硬件的重要性当然没有消失。芯片要提供算力,内存要保证运行,电池还得承担更高的功耗,这些都是AI能够在手机上运行的基础。只是当这些条件逐渐具备之后,用户对AI手机的期待也开始发生变化。
AI手机应该是什么样?
过去十几年,手机的使用方式一直没有太大变化。
当你想干一件事,你需要下载好对应的App,然后手动操作。就像当你订一张机票时,需要先打开订票软件,选城市和日期,再从航班里慢慢筛,最后付款。要查路线就再打开地图,要记录行程再去日历,要听歌就要打开音乐应用一样。总之,一件事情经常要在几个App之间来回切换。
AI手机现在想做的,就是把这些步骤接过去。你可能只需要说一句,AI就能自动帮我搞定所有流程,所有App、所有操作都会被AI串联起来,用户也就从原来的操作者,变成了给手机下任务的人。
今年WAIC期间,努比亚和字节跳动合作的手机已经演示过类似能力。一句话下去,AI可以同时在抖音搜视频、在去哪儿查机票、在瑞幸点咖啡,多项任务同时进行。
从这些演示里,其实已经能看出AI手机接下来大概会往什么方向发展。
用户不再需要记住每个功能藏在哪个App里,也不用亲自完成中间的每一步。只需要说清楚自己想干什么,剩下的交给手机。
AI为什么很难真正接管手机?
然而,让AI看懂手机屏幕,其实已经没有想象中那么困难。
现在的大模型可以识别按钮、文字和页面内容,也可以模拟人的点击、滑动和输入。很多手机智能体今天就是这么工作的。它看到屏幕上有什么,再判断下一步应该点哪里。
真正麻烦的是,AI看得懂,不代表它有权去做。
今天的手机里,每个App都有自己的账号、数据和权限。微信里的聊天记录、淘宝里的订单、支付宝里的支付能力,都掌握在各自的应用里。手机厂商想让AI直接调用这些能力,就需要App厂商开放接口和权限。
对于App厂商来说,开放的权限越深,需要承担的安全风险也越高。尤其涉及聊天、购物、支付这些内容,一次错误调用可能带来的就不只是操作失败。所以很多核心能力不会轻易交给第三方AI,更不可能让它在没有限制的情况下自由操作。
这也是现在很多手机AI仍然要靠识别屏幕和模拟点击完成任务的原因。既然拿不到App内部的能力,就只能像用户一样,在外面一层一层操作。
可这条路也有明显的问题。App更新一次界面,按钮换个位置,突然弹出广告,或者网络稍微卡了一下,AI后面的操作都可能跟着出错。任务越长,中间的不确定因素越多。
所以手机厂商开始让AI进入系统更深的位置。过去的AI更多是手机里的一个功能,需要的时候打开,用完以后退出。现在它开始参与任务处理,调用系统能力,也尝试把不同应用和服务串起来。
阶跃星辰今年发布的Step AOS,就是其中一种尝试。它围绕智能体来设计系统,希望AI可以直接参与任务执行,减少对屏幕识别和模拟点击的依赖。
但即便系统解决了,另外一个问题依然绕不开,用户敢不敢把这些权限交给AI?
让AI查个天气、搜个视频,做错了重新来一次就行。但如果它可以读取通讯录、查看日历、处理订单,甚至接触账号和支付,用户需要考虑的东西就多了。AI会不会理解错自己的意思?会不会执行了自己并没有要求的操作?它读取了哪些内容,这些数据去了哪里?哪些事情可以自己完成,哪些事情必须经过用户确认?这些问题不解决,AI的权限就很难真正放开。
所以现在涉及付款、账号变更、重要授权等操作时,大多数方案仍然需要用户自己完成最后确认。AI可以替你把事情做到最后一步,但这一脚能不能迈出去,还得由人决定。这也是AI手机现在最难处理的地方。权限给得少,AI能做的事情有限。权限逐渐增加以后,对安全、隐私和准确性的要求也会跟着提高。
而且这件事光靠手机厂商自己解决不了。操作系统可以给AI更多能力,大模型也可以继续提升,但微信、淘宝、支付宝这些App愿意开放到什么程度,同样会决定AI最终能做多少事情。
因此,手机AI以后能不能真正接手大量操作,很大程度上就取决于这些问题怎么解决。
写在最后:
总之,AI手机发展到现在,模型能力可能已经不是唯一的问题了。
看懂一句话、识别一个页面、判断用户想做什么,这些能力都在不断成熟。接下来更难的,是怎么把这些能力真正接进手机原有的系统和App生态里,同时又不让AI获得失控的权限。
这也让AI手机和过去的硬件升级有些不同。过去芯片更快、内存更大、电池容量更高,提升通常比较直接。AI手机则牵涉手机厂商、操作系统、App厂商和用户几方,任何一环没有跟上,体验都会受到限制。
如果有一天,这些问题都变得像今天打开一个App一样自然,AI手机的变化才算真正落到了日常使用里。

评论
更多评论