关于ZAKER Skills GEO服务 合作
钛媒体 2小时前

请来 Claude 老祖,谷歌能借 Agent 翻身吗?

文 | 字母 AI

谷歌也做 agent 了,底气居然是 Claude 给的。日前,Google Cloud 发布了新的 Gemini Agent。名字叫 Gemini,但碰上难搞的任务,它还可以调用 Claude。

在 Agent 圈,Claude 老祖已经成了香饽饽。就在前一天,马斯克刚刚宣布 Grok Bot 今后会根据任务选择最合适的模型,名单里同样有 Claude。

谷歌尤其需要一点外援。

一周前,谷歌刚端出新一代旗舰模型 Gemini 4 Argon,榜单刷得很漂亮,奈何并未向公众开放。根据报道,它的实际表现与外界对谷歌的期待相比,还是差点意思。

模型赛道没能打出一个漂亮的翻身仗,Agent 这边倒是突然热闹起来:Meta 的 Muse 刚刚带火了个人 Agent,一条新的弯道,摆在了谷歌面前。

谷歌能借着 Agent 实现弯道超车吗?恐怕没那么容易。

不过上路试试总比像苹果那样僵立不动强,至少这条新赛道还没来得及给谷歌来上一套熟悉的连环暴击。

谷歌终于拿出了一个像样的 Agent

认真说起来,谷歌可能是全世界最适合做 Agent 的公司之一。

如果把一个 Agent 需要的东西摊开来看,模型、工具、数据、执行环境和用户入口,谷歌几乎什么都有。

尤其是,谷歌拥有一整套经营了 20 多年、并且已经牢牢占据了用户心智的办公产品。

从 Gmail、Calendar 到 Docs、Sheets、Drive,再到团队使用的 Google Chat,很多人的工作本来就在谷歌的生态里完成;其他公司的办公 Agent 想要真正替用户干活,很多时候也绕不开谷歌。

在其他 Agent 纷纷接入谷歌的产品之后,谷歌也终于开始认真利用它的这份家底了。

当地时间 10 月 8 日的 Gemini at Work 大会上,谷歌云 CEO Thomas Kurian 正式介绍了新的 Gemini Agent,试图把 Workspace 里原本分散的应用、数据和工作流程组织成一个统一的工作 Agent。

比如,你只需要告诉它:" 帮我约一下上次活动的几位负责人。"

Gemini Agent 就可以结合此前的邮件、群聊和日历记录,在授权范围内找到相关人员,检查时间,再发邮件协调会议。用户不用重新告诉他每个人是谁,也不需要挨个打开应用操作。

凭借谷歌强大的生态,Gemini Agent 可以直接进入谷歌应用的工作流程。在 Gmail 里,如果老板发了邮件,要求把最新项目进展整理成 PPT,Gemini 可以主动识别任务,并提供一键委托的入口。它也可以在 Docs 里修改文档,在 Chat 里响应任务,跨应用工作时保留相同的上下文、记忆和技能。

当然,跨应用执行、长期记忆、云端运行,在整个 AI 圈里算不上什么新鲜功能。Meta 的 Muse 能通过专属云端电脑和浏览器替用户购物、发邮件、安排出行; OpenAI 的 Dots 同样拥有独立云电脑,可以连接用户授权的应用,在用户离开后继续推进任务。

谷歌真正的优势在于,Gemini Agent 的能力可以直接与现成的企业协作体系相结合。

除了作为个人助手,Gemini Agent 还可以变成一名长期工作的团队成员。谷歌把这种形态称作 Coworker Agent,用户只需要描述希望它承担什么岗位,Gemini 就能创建一个拥有固定职责和独立身份的 AI 同事。

举个例子,市场团队可以创建一名负责活动协调的 Agent。这个 Agent 会获得自己的 Workspace 账号,包括邮箱、日历和 Drive 储存空间。

它甚至可以出现在公司的通讯录里。同事可以像找其他员工一样,在 Google Chat 里 @它分配任务,或者在 Docs 子评论区要求它修改文件。

再加上谷歌云和 BigQuery 等数据基础设施,Gemini Agent 还可以连接企业数据库,调用分析工具,甚至根据公司已有的业务指标和定义生成报表。

谷歌因此有机会把 Agent 的工作范围从员工日常使用的办公软件,进一步延伸到企业后台的数据和业务系统。

顺便一提,微软同样拥有 Microsoft 365 和 Azure 这样的完整生态,它甚至更早把 Copilot 放进了办公软件。但做了这么多年,微软也没能把分散在各个产品里的 AI 能力彻底整合起来。

该说不说,家底厚归家底厚,能不能把这些资源真正用起来,是另外一回事。

这一次,谷歌还有一个非常值得肯定的地方:它这回想得挺开,意识到了自家的 Gemini 未必能包办所有事情。

于是,它把 Claude 老祖也请来一起干活。

Thomas Kurian 在官方介绍里明确表示,Gemini 本身是一个智能体,其背后的具体模型可以自由选择。它会根据任务的性质选择更合适的模型来完成任务。

目前,Gemini Agent 可以在自家的 Gemini 和 Anthropic 的 Claude 之间调度,未来还会支持其他模型。

官方给出的解释倒是挺好听,说最强的模型可能隔几个月就换一家,不同任务不一定需要同样的模型,灵活选择供应商还能兼顾效果与成本。

但实际上,即使在谷歌自己刷的漂漂亮亮的评测表里,Gemini 4 Argon 在 Terminal-Bench 4.0 上只拿了 57.4%,Claude Opus 5.5 却有 66.4%;FrontierSWE v2 上,Argon 同样以 55.0% 落后于 Claude 的 62.3%。(第三方独立评测的数据有些不同,但我们先看谷歌自己的榜单。)

至少在部分复杂编程和 Agent 任务上,谷歌还真没能赢过 Claude。

而据《商业内幕》10 月 9 日的报道,一位谷歌员工认为,早期测试的 Argon 在部分 Coding 任务上,甚至落后于上一代的 Claude Opus 5。

谷歌这次也算给自己留了条后路:碰上自家模型啃不动的硬骨头,好歹还能摇人。

谷歌云其实此前就允许企业开发者使用 Claude,不过这一次,它把多模型选择进一步带进了自己提供的通用工作 Agent。

至少在这条企业产品线上,谷歌开始明确把 Agent 本身的竞争力放在了自家模型的独占性之前。

这一步,我觉得值得肯定。

谷歌为什么总是慢一步

不过话说回来,谷歌以前难道没做过 Agent 吗?

早在 2024 年 12 月,谷歌就推出了 Google Agentspace,把 Gemini 的推理能力、谷歌搜索和企业数据整合起来,让员工能够跨系统搜索信息、创建和使用 Agent。

2025 年 4 月,谷歌又推出 Workspace Flows,让用户可以用自然语言创建自动化工作流。比如收到客户反馈后,AI 可以自动读取表单、分析问题、查找解决方案,再生成回复,交给客服审核。

到了去年 10 月,谷歌干脆把 Agentspace 整合进新推出的 Gemini Enterprise,试图打造一个统一的企业 AI 工作入口。

从企业搜索、跨应用自动化,到 Agent 的创建和调度,谷歌早就证明了自己有这个技术。

可问题是,别人已经用 Manus、Muse 等产品建立起了鲜明的 Agent 产品认知,谷歌却始终没能拿出一个同样出圈的代表作。

今年 5 月的 Google I/O 大会上,谷歌倒是也推出了个人 Agent Gemini Spark,但这一炮打出去,几乎没激起什么水花,和哑炮也没太大差别。

该有的东西谷歌都有,却迟迟没有做出什么名堂。

对熟悉谷歌的读者来说,这种剧情讲真一点也不陌生。

回头看过去几年,从通用大模型到 Chatbot,再到如今的 Agent,谷歌似乎总赶不上一口热乎的。

2017 年,谷歌的研究人员提出了 Transformer 架构,为后来的大语言模型奠定了重要基础。

论研究,谷歌有 DeepMind 这样的顶尖团队。论算力,它很早就自研 TPU。再加上充足的资金和庞大的产品生态,它几乎找不到明显的短板。

结果到了通用大模型时代,OpenAI 先用 GPT 系列打出了招牌。

早在 2019 至 2020 年,谷歌的工程师 Daniel De Freitas 和 Noam Shazeer 就已经在内部开发出一款对话机器人。两人很早就看到了 Chatbot 的商业潜力,还多次推动谷歌把产品开放给外部研究者,接入 Google Assistant,甚至直接公开演示。但谷歌管理层始终没有点头。

有意思的是,Shazeer 后来离职创办 Character.AI,2024 年被谷歌通过一笔 27 亿美元的技术授权交易请了回来,今年 6 月又一次离开谷歌,转投 OpenAI。

结果 2022 年底,ChatGPT 又抢先引爆了消费市场,打开了 Chatbot 的时代。

谷歌随后匆忙应战,甚至有些过分着急。2023 年 2 月,谷歌的 Bard 还没正式向公众开放,就已经因为宣传演示中的一道错误回答闹出了笑话,叠加当天发布会表现不及预期,谷歌母公司 Alphabet 股价当天大跌,市值蒸发约 1000 亿美元。

当然,后来的 Gemini 在模型能力上确实追了上来——追上了一段时间——谷歌的 AI 业务也并没有到失败的程度。

但有趣的地方就在这了,谷歌似乎总能提前掌握通往下一代技术的门票,却很难成为第一个把新产品做火的人。

以前是模型和 Chatbot,现在轮到了 Agent。

论技术、资源和用户基础,谷歌每次都算是最有希望的选手之一。可真到了市场竞争的时候,它又常常变成追赶者,跟在别人的屁股后面。

我觉得,这可能也是老牌科技巨头共同的难题——他们主观上是想要做成事的,只是尾大不掉,容易被组织拖累。

老牌公司并不缺人才、技术或者决心,甚至可以认为,恰恰是过去几十年的成功,让他们建立了一套庞大、成熟又很难轻易改变的组织体系。

但问题在于,Agent 要做的恰恰是打破不同产品之间的边界。

对于创业公司来说,做 Agent 是从头设计一款新产品,接入别人的生态;但对谷歌这样的巨头来说,则意味着要重新组织自己过去 20 多年积累的产品和业务。

业务越成熟,转型起来就越困难。一个新的功能能否推出,不仅取决于技术上能否实现,还要考虑原有用户是否接受、是否会影响已有的业务,以及出了问题该由谁来负责。

有顾虑是合理的,但等大公司把方方面面都考虑清楚,市场可能已经被别人抢先占领了。

除了谷歌和前一部分提到的微软,亚马逊和苹果也有类似的问题:

亚马逊早在 2014 年就把 Alexa 送进了千家万户,背后还有 AWS、电商和庞大的智能家居生态,但到了大模型时代,Alexa+ 却经历了漫长的开发和上线波折,始终没能像 ChatGPT 一样掀起新的产品浪潮。

苹果更不用说,手握数十亿设备、完整的软硬件生态和 Siri 这个现成入口,却在新一轮 AI 竞争中有心无力,原本承诺的个性化 Siri 一再延期,直到今年才正式推出大幅升级,而且还是预览阶段。

这些巨头明明早早拿到了入场券,却常常要花更多的时间,才能真正挤上车。

当然,我们不能把所有问题都归咎于大公司的组织臃肿。但至少从过去几轮 AI 产品竞争来看,谷歌在技术储备和产品表现之间,始终存在着一种颇为尴尬的落差。

如今,Muse、Dots 等产品已经把长期工作的 Agent 推到了台前,Grok Bot 也开始强调根据任务选择合适的模型。

谷歌这次拿出的 Gemini Agent,至少在产品思路上跟上了这一轮变化,开始把分散的办公应用组织起来,同时允许外部模型参与执行任务。

只是目前发布的 Gemini Agent,和之前的 Gemini 4 Argon 一样,还只是面向部分客户的私人预览阶段。

谷歌在发布会上展示了很多能力,但产品究竟行不行,现在还没有答案。

想靠 Agent 实现弯道超车,谷歌值得一试。不过眼下最要紧的,恐怕是先把车从发布会开到用户手里。

Claude 老祖,正在成为 Agent 公共底座

在找外援这件事上,谷歌和马斯克不约而同地选择了 Claude。

这就很有意思了,谷歌有 Gemini,马斯克有 Grok,两家公司都在花大价钱训练自己的模型,可真到了做 Agent 的时候,却都愿意请 Claude 来 " 坐阵 "。

看起来,到了 Agent 时代,谁家的模型最好用,和谁家的 Agent 最好用,开始变成两回事了。

其实想想也不奇怪。Agent 本来就给那些模型暂时不够强的玩家提供了一次弯道超车的机会。

Meta 的 Muse 就是个现成的例子,它背后的 Muse Spark 并没有统治模型排行榜,却不妨碍 Muse 成为今年最受关注的个人 Agent 之一。

当然,Meta 选择了用自家的模型支撑 Muse。但对谷歌、马斯克来说,既然 Agent 的竞争力不再完全取决于底层模型的排名,又何必非要被自己的模型绑死?

谁的模型好用,就调用谁的。自己擅长的任务自己做,没那么擅长的就交给别人。

至少在 Agent 这条赛道上,能不能把活干好,开始比是不是自家模型干的更重要。

对谷歌这样的公司来说,它不必等到 Gemini 在每一个领域都拿到第一,才有资格做出一款好 Agent。

而对 Anthropic 来说,当越来越多 Agent 开始自由选择底层模型,Claude 就有机会成为这些产品共同使用的一套基础能力。

谷歌和马斯克都点名 Claude,首先当然与模型实力有关。尤其是在编程、工具调用和复杂任务执行上,Claude 已经积累了相当强的竞争力。

以 Vals AI 10 月 7 日更新的 Terminal-Bench 4.0 独立排行榜为例,Claude Opus 5.5 拿到了 65.15% 的成绩,Claude Sonnet 5.5 紧随其后,Gemini 4 Argon 则是 57.58%。

虽然单项评测不能代表所有场景,但至少在 Agent 最需要的部分能力上,Claude 的口碑可以说是相当权威。

如果看更综合的智能水平,在 Artificial Analysis 的 Intelligence Index 里,榜单前三分别是 Opus 5.5、Sonnet 5.5 和 Fable 5.1。

而且,Anthropic 还在主动把 Claude 变成开发者构建 Agent 时最顺手的选择。

Claude Code 就是最好的例子,从一款编程 Agent 开始,Anthropic 正在逐渐把 Claude Code 背后的工具调用、上下文管理、权限控制和多 Agent 协作能力,开放给其他开发者。

去年 9 月推出的 Claude Agent SDK,已经让开发者可以借用 Claude Code 的底层框架,去搭建自己的 Agent。到了今年 10 月 1 日,Anthropic 又给 Claude Code 开放了 Mods。开发者可以用少量 TypeScript 代码修改它的行为、界面,甚至替换内置功能,并通过插件分享给其他人。

几天之后,Anthropic 又开始给开发者 " 发钱 "。

10 月 6 日,它宣布扩大 Claude Startups 计划,为符合条件的创业团队提供一年 Claude Team、1000 美元 API 额度,以及其他开发资源和支持;10 月 7 日,Claude Max 和 Team 订阅用户也开始获得每月 API 额度,可以拿去调用 Claude 模型、使用 Agent SDK,或者运行自己开发的 Agent。

从开发框架、插件生态,到直接补贴 API 调用,Anthropic 正在想办法让更多开发者围着 Claude 构建产品。

一个开发者用 Claude 做出了 Agent,下一个开发者就可能沿用他的工具、代码和经验;做在 Claude 上的产品越多,后来的人选择 Claude 也就越方便。

当然,这不意味着 Claude 已经垄断了 Agent 的底层市场。

模型能力和价格变化很快,谷歌强调多模型调度,某种程度上就是为了避免被任何一家模型厂商绑住。今天 Claude 最适合的任务,明天也可能交给 GPT、Gemini 或者其他模型。

但这恰恰也是 Anthropic 需要提前经营开发者生态的原因。

当然,OpenAI 也没闲着。

论模型的智能水平,GPT 和 Claude 其实没有拉开特别大的差距,在不同任务上各有优势。而且OpenAI 同样在争夺 Agent 的底层市场。

但 OpenAI 还有另一重身份:它自己也是 Agent 市场的竞争者。

DevDay 上,OpenAI 刚刚推出了常驻 Agent 产品 Dots;10 月 9 日又更新了移动端创建功能,用户现在可以直接在 ChatGPT 手机 App 里创建自己的 Dot。

Anthropic 当然也在做自己的 Agent 产品,但 OpenAI 的 Dot 已经直接进入个人助理和办公 Agent 市场,和谷歌、马斯克想做的事情有了更多重叠。

更何况,OpenAI 的 " 人缘 " 似乎也没 Anthropic 那么好。

谷歌和 Anthropic 有长期合作关系。双方在模型供应、云计算和 TPU 算力上已经有不少商业往来,Gemini Agent 选择 Claude,有现成的合作基础。

而在马斯克那里,他和 OpenAI 的官司都还没打完,想让 Grok Bot 主动请来 GPT 帮忙,恐怕还需要一点额外的想象力。

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容