关于ZAKER Skills 合作
钛媒体 2小时前

Pixel 11 来了,AI 真的能接管你的手机吗?

文 | 字母 AI

8 月 12 日,谷歌正式发布 Pixel 11 系列,包括 Pixel 11、Pixel 11 Pro、Pixel 11 Pro XL 以及折叠屏 Pixel 11 Pro Fold。

新机全系搭载 Tensor G6 芯片,并继续升级影像、屏幕和机身设计。但相比这些常规升级,Pixel 11 更值得关注的,是 AI 正在如何改变手机的使用方式。

在发布会上,谷歌重点展示了 Gemini 如何进入 Android 系统工作流:它可以跨越 40 多个应用完成多步骤任务,还能够结合邮件、日历和航班信息理解用户上下文。

值得一提的是,Pixel 11 发布第二天,谷歌又推出了 Gemini 3.7 Flash。与此同时,据爱范儿 /APPSO 报道,重组中的 Google DeepMind 可能把更多研发重心转向性价比更高的 Flash 级模型,团队还可能迎来大规模裁员,比例达到 1/3 甚至更高。

Flash 模型对手机意义尤其明显,它能以更低成本、更快速度支撑高频 AI 任务。

智能手机过去的发展方向,是不断扩张功能边界,把越来越多的功能放进一块屏幕里;而 AI 时代的发展方向,可能是不断收缩用户面对的复杂性。

在这个方向上,我们很容易想到我们的 " 老朋友 " 豆包手机:Pixel 依靠 Android 系统,让 AI 更深入地融入手机体验;豆包手机则试图通过 Agent 和应用生态,让 AI 成为连接用户与互联网服务的新入口。

Pixel 11 都发布了,豆包手机二代还远吗?

Pixel 11:Gemini 开始,跨 40 多个应用执行多步任务

8 月 12 日,Google 正式发布 Pixel 11 系列,包括 Pixel 11、Pixel 11 Pro、Pixel 11 Pro XL 以及折叠屏 Pixel 11 Pro Fold。同时亮相的还有 Pixel Watch 5 和全新的防丢设备 Pixel Tag。

作为一年一度的旗舰更新,Pixel 11 依然带来了常规的手机升级。

新机搭载 Tensor G6 芯片,端侧处理速度最高提升 3.5 倍、能耗最高降低约 3.5 倍;影像系统继续强化计算摄影能力,并针对拍摄、视频处理等场景加入更多 AI 能力。

从外观来看,Pixel 11 延续了 Pixel 家族标志性的横向摄像头模组设计,并进一步调整了镜头排列和机身设计。相比一些手机越来越夸张的镜头凸起,Pixel 11 的背部设计更加简洁,横向排列的摄像头让机身视觉上更加平衡——并且可以比较稳定地放在桌子上。

过去几年,手机厂商一直在尝试把 AI 加入手机,但大多数时候,AI 只是一个附加功能,藏在相机或者备忘录里,帮你修一张照片、写一段文字、回答一个问题。

Pixel 11 则展示了另一种完全不同的手机使用方式:只需要动动嘴,Gemini 自己帮你处理。

谷歌希望 Gemini 不只是一个等待用户调用的助手,而是成为手机中的智能层,能够理解用户正在做什么,并主动协调不同功能完成任务。

最值得关注的是它的跨应用能力——Gemini 可以跨越 40 多个应用完成多步骤任务。

过去用户想完成一件事情,往往需要自己拆解流程,但在 Pixel 11 展示的未来里,用户无需事事关心。

你只要告诉 Gemini 目标,剩下的事情,由它理解需求、调用应用、协调流程,然后找你确认。

换句话说,谷歌开始让 Gemini 从一个 " 功能助手 ",变成了一个住在手机里、能够跨应用完成任务的 Agent。

这种理解用户的能力,也被 Google 延伸到了更多日常场景。

Rambler 让语音输入变得更加自然。用户可以像平时聊天一样表达,Gemini 会自动过滤口语中的停顿和重复,把它整理成更适合输入的文字。

Magic Capture 则把 AI 带入拍摄流程。它会分析拍摄过程中的多个画面,帮助用户挑选更好的瞬间,减少拍摄之后筛选和编辑的步骤。

需要区分的是,Pixel 11 并不是把完整的 Gemini 大模型都塞进了手机。Tensor G6 搭配最新版 Gemini Nano,主要负责端侧 AI 任务;更复杂的 Gemini 能力仍会调用云端模型。

根据公开资料,谷歌并没有为 Pixel 11 绑定一个固定的云端 Gemini 版本——而就在新机发布后的第二天,谷歌又推出了 Gemini 3.7 Flash。

相比上一代,3.7 Flash 进一步强化了多步骤规划和工具调用能力,并提升了复杂工作流中的执行准确性;其限时 API 价格也降至 3.6 Flash 原始价格的一半。

不过,Google 目前明确宣布的是 Gemini Spark 从当天开始使用 3.7 Flash,但并未表示 3.7 Flash 已经成为整个 Gemini App 的默认模型。

过去几个月,谷歌在旗舰模型上的追赶并不顺利,新一代 Gemini 旗舰模型一再延期,Noam Shazeer、John Jumper、Jeff Dean、Quoc Le 等多位核心 AI 人才也相继离开。与此同时,Flash 模型在快速迭代,从 3.5、3.6 一路更新到 3.7。

但对于手机来说,Flash 可能比单纯追求旗舰模型更有现实意义。

手机里的 AI 要随时理解用户需求、调用工具、跨应用执行任务,这意味着模型不仅要足够聪明,还必须足够快、足够便宜,并且能够稳定地完成大量高频操作。

从这个角度理解,Flash 路线可能不只是技术选择,更是 AI 硬件能够规模化存在的经济学前提。

这也是 Pixel 11 这次 AI 升级的核心,比起把一个最强的模型塞进手机,谷歌更希望让 Gemini 真正进入手机的日常工作流。

从跨应用执行任务,到理解用户上下文,再到介入日常拍摄和输入,Pixel 11 展示的是谷歌对于 AI 手机的一种想象:

手机不再只是承载功能的设备,开始成为理解用户需求的入口。

但一台越来越懂用户的手机,会不会也正在改变过去人与互联网互动的方式?

AI 正在改变手机,也正在挑战移动互联网

回看过去二十年的互联网发展,人们使用互联网的方式一直在变化。

PC 互联网时代,浏览器是连接用户与互联网的主要入口。用户打开浏览器,输入网址,搜索信息,访问网站。

互联网公司之间的竞争,争的是谁能成为用户进入互联网的第一扇门。

2007 年,乔布斯发布第一代 iPhone 时,改变的不只是手机形态。更重要的是,它重新定义了人与互联网的连接方式。

一块触控屏,让互联网真正大规模进入了普通人的口袋。

随后,App Store 的出现进一步改变了移动互联网的分发方式。过去,用户通过浏览器访问网站;后来,用户开始通过 App 获取服务。

社交、购物、支付、地图、娱乐、办公……越来越多功能被装进手机,智能手机也从一个通讯工具,变成了移动互联网的入口,甚至是最大众的入口。

但 App 时代的繁荣,有一个隐藏前提:用户需要主动操作手机。

打开微信聊天,打开抖音视频,打开淘宝购物,打开美团外卖……用户的每一次点击、搜索、浏览和停留,都是移动互联网生态的一部分。

而对于平台而言,用户操作不仅是使用过程,也是商业价值的来源。

内容平台依靠用户停留获得广告收入,电商平台依靠用户搜索和购买完成交易,社交平台则依靠用户互动维持网络效应。

而 AI 正在推动事情往相反的地方发展。

过去,互联网不断增加用户可以使用的功能,手机屏幕里装下越来越多 App,但 AI 希望把这些复杂性重新隐藏起来——用户不需要知道应该打开哪个 App、应该点击哪个按钮、应该经过多少步骤。只要表达目标,AI 就能帮你完成。

从这个角度看,AI 正在推动手机从 " 功能扩散 " 走向 " 交互收缩 ",而这种收缩,和互联网本身的分发逻辑存在冲突。

以搜索引擎为例,搜索引擎曾经是互联网分发的重要基础设施:用户提出问题,搜索引擎提供入口,网站获得访问。但 AI 搜索正在尝试直接满足用户需求。

Google AI Overviews 会在搜索结果页直接生成答案,减少用户进一步点击网页的必要。该功能推出后,Pew Research Center 对 900 名美国成年人的浏览数据进行分析发现,在 2025 年 3 月的 Google 搜索中,遇到 AI 摘要时,用户点击传统搜索结果链接的比例约为 8%;没有遇到 AI 摘要时,这一比例约为 15%。

也就是说,AI 正在减少用户离开搜索页面、进入其他网站的需求

受到影响的不只是网站流量,还有信息生产者与用户之间的连接方式。

过去,内容生产者依靠搜索和推荐获得曝光;但当 AI 直接整理答案并交付给用户时,用户与原始内容之间的距离正在被拉长。

越来越多内容平台和网站因此开始担心 " 零点击搜索 "(zero-click search):用户获得了答案,但没有再点击那个提供答案的网站。

这正是 AI 时代最大的矛盾——对于用户来说,减少操作是一件好事,但对于互联网平台来说,用户操作本身就是入口。

AI 希望减少用户操作,但移动互联网过去的商业价值,恰恰来自用户操作。

下一代 AI 手机,需要重新定义 " 操作 "

这是一个非常复杂的困境:

如果 AI 完全替代用户操作,那么过去围绕 App 建立起来的移动互联网生态会被重新改写。用户不再打开 App、浏览内容,不再主动搜索,原本依靠用户行为建立起来的分发体系也会发生变化。

但如果 AI 只是一个附加助手,只是在聊天框里回答问题、偶尔提供建议,那么它又无法真正改变手机的使用方式。

因此,AI 手机需要重新思考 " 操作 " 本身的意义。

毕竟手机里的操作并不全部属于同一种类型。有些操作,本质上只是为了完成目标而不得不经历的步骤,比如搜索信息、切换应用、填写表单、寻找功能。但也有一些操作,本身就是使用手机的目的,比如刷视频、看内容、和朋友聊天、分享生活……这些行为并不是阻碍,而是用户主动参与互联网的方式。

真正需要被重新设计的,是那些连接用户与互联网服务的中间步骤。

过去,用户通过浏览器、搜索引擎和 App 找到服务;未来,AI 可能成为新的中间层,理解用户需求,并调用背后的互联网服务。

换句话说,AI 手机需要重新定义,哪些操作应该交给 AI,哪些操作应该继续留给用户。

而这也是 Pixel 11 和豆包手机探索的不同方向。

某种意义上,豆包手机一代和 Pixel 11 走在相似的道路上:让 AI 进入手机,帮助用户完成原本需要自己操作的任务。

Pixel 依靠 Android 系统和 Google 自身服务,希望让 Gemini 更深入地融入手机工作流。而豆包手机一代则更强调 Agent 能力,让 AI 理解手机界面、调用应用,像用户一样完成任务。

这种模式下,需要解决的问题是 AI 如何更懂用户、更好地操作手机。

但 AI 会操作手机,并不等于 AI 真正连接了互联网。

手机里的 App 并不是一个开放的工具箱,支付、社交、购物等高价值场景,都涉及权限、安全和商业边界。

谷歌的优势在于,它拥有 Android 这个手机操作系统,因此可以让 AI 更深入地进入设备内部,调用系统能力,并结合 Gmail、Calendar 等 Google 服务提供上下文信息。

但 Android 并不能解决所有问题,因为手机系统掌握的是设备能力,而互联网服务掌握在一个个独立 App 手中。是否开放能力、开放哪些能力,仍然取决于应用自身。

某种意义上,豆包手机二代正在探索另一种方向——从让 AI 学习如何操作 App,转向让应用以 AI 能够理解和调用的方式提供能力。

据目前公开信息,相比第一代更强调 Agent 像用户一样操作手机,二代开始尝试通过 MCP(Model Context Protocol,模型上下文协议)和 A2A(Agent-to-Agent,智能体协作)等方式,让 AI 与应用之间建立更直接的连接。

比如,在传统的 Agent 操作模式下,用户告诉 AI" 帮我订一张明天去上海的机票。"AI 可能需要打开旅行 App,识别页面上的搜索框、按钮和菜单,再像用户一样填写出发地、目的地和日期。

但如果应用通过标准化接口向 AI 开放能力,未来的流程可能变成:用户提出需求,AI 理解意图,然后直接调用航空或旅行服务提供的查询、筛选、预订能力,并在关键节点让用户确认。

两者的区别在于,前者让 AI 学习如何使用 App,而后者则要求 App 学会如何向 AI 提供能力。

当然,这并不意味着所有应用都会立即接入这种体系,豆包二代具体能做到什么程度,还要等它真正推出以后才能确认。

两种方式背后,其实对应着两种不同的交互关系。

如果 AI 只是模拟用户操作 App,那么它实际上是在绕开原有的应用入口。但如果应用主动向 AI 开放能力,那么 App 并不会消失。

它仍然提供服务,只是用户触达服务的方式发生了变化。

关于 AI 手机的最终想象,仍然是当我有事情要解决的时候,只需要一句话,AI 能直接在手机里帮我解决。但 AI 不能帮我完全接管手机,因为我们的生活并不只有效率。

下一代 AI 手机真正需要做的,是让 AI 接管那些没有价值的重复步骤,同时保留人与互联网互动中真正有意义的部分。

最新评论

没有更多评论了

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容