关于ZAKER Skills 合作
钛媒体 1小时前

OpenAI 按下竞速暂停键:大模型退烧,企业 AI 进入结果验收时代

文 | 独角兽观察,作者 | 挖哥,编辑 | 角叔

当地时间 9 月 12 日,全球 AI 赛道出现标志性转向:Anthropic 公开呼吁行业主动放缓前沿大模型迭代节奏,OpenAI CEO 奥尔特曼公开表态认同该主张,同时明确排除 2026 年推进 IPO 的计划。曾经全力冲刺模型参数、追逐 AGI 叙事的头部实验室,开始主动给前沿基座竞速踩下刹车。

与此同时,二级市场 AI 龙头估值集体出现震荡回调,国内一级市场资金也逐步告别盲目追捧纯大模型概念项目的阶段。

当全球资本市场对大模型的热情快速回落,一个尖锐的行业共识正在形成:过去两年的企业 AI 项目,大量停留在 " 可演示、难验收 " 的阶段。投资人、CIO(首席信息官)们已经厌倦了参数榜单、流畅对话与炫酷 Demo,采购决策的标尺发生根本性切换 —— 不再问模型有多强,而是追问能不能稳定交付可量化业务结果。

一边是不少企业 AI 项目陷入 " 上线即闲置 " 的困境:投入百万级预算做完私有化部署,报表上能看到模型评测高分,但放到真实业务里,幻觉频发、流程断点多,很难计入业务指标;另一边,垂类智能体岗位化落地案例持续跑通,RaaS、结果分成等商业模式开始落地。

市场正在完成一次筛选:通用大模型负责想象力,岗位化 Agent 负责兑现生产力,企业 AI 正式进入结果验收时代。

01 采购逻辑彻底反转

2023 到 2024 年,企业 AI 采购的核心叙事是 " 技术先进性 "。CIO 选型会优先对比参数量、MMLU 等评测分数、多模态能力,厂商比拼谁的 Demo 更惊艳。这一阶段,AI 更像企业的创新试验品,考核目标是 " 完成 AI 试点 ",而不是业务降本增收。

但这种逻辑在真实业务场景里存在天然短板。通用大模型擅长开放式对话,面对强规则、高追责的行业场景,幻觉、不可溯源、推理成本高三大问题很难绕开。很多厂商采用 " 通用 API+RAG 套壳 " 快速交付项目,上线之后一旦进入高峰业务量,时延波动、回答不可控、审计缺失等问题集中暴露。项目验收时,技术指标很漂亮,但业务部门拒绝买单。

行业的评价体系正在重构。

企业不再为 " 模型功能 " 付费,只为稳定、可审计、可核算的业务结果付费。结合 Gartner 相关调研,近两年企业 AI 项目失败的首要诱因,往往并非技术本身,而是难以建立 AI 产出与业务 KPI 之间可信的对应关系。过去甲方采购是买断软件、一次性交付;现在越来越多组织倾向按效果结算,把 AI 的价值锚定在工单办结率、质检差错率、获客转化、人力节省等硬指标上。

赛道分化也在办公场景率先显现。微软 Copilot、钉钉 AI、腾讯 WorkBuddy 相继入局,百度推出桌面端智能体百度搭子,主打一句话下达目标、跨文件跨软件自动执行,把 AI 从文本对话升级成可动手干活的办公助手。大厂在 AI 办公的激战,本质是争夺通用场景的效率增量,但这类产品更多解决个人与团队的文档、报表、汇报类工作,容错空间更高,并不适配物流、金融、运营商这类高并发、强服务标准、强监管的产业级业务场景。

这一转变,也倒逼赛道彻底分化:一条路线继续追逐通用基础模型的能力上限,主打普惠效率提升;另一条路线向下扎根产业场景,把智能体封装成可以全天候上岗的岗位劳动力,解决高频、标准化、可量化的产业刚需。

百融智能 CEO 张韶峰提出的 " 硅基员工 " 概念,正是对这一趋势的具象表达:AI 不再是辅助工具,而是可以独立承担完整岗位职责、纳入业务考核、适配生产节奏的硅基生产力。它不追求模型通用全能,而是围绕具体岗位的真实作业流程,整合语音交互、长对话理解、业务决策、合规留痕能力,形成端到端执行闭环。依托百工 AgentOS 智能体构建平台,这类硅基员工落地于客服、运营、风控等一线岗位,以 RaaS (结果即服务)模式绑定业务指标结算,彻底脱离传统模型售卖、项目制交付的浅层模式。

创新工场董事长李开复在多场公开访谈中表达过相似判断:AI 生产力变革的关键,不在于通用模型的极限能力,而在于把大量标准化、重复性工作交由智能体承接,把人力释放向更具创造性的工作。

02 Agent 赛道内外分野

海外 Agent 创业公司更早探索岗位化落地,代表企业 Sierra 把智能体聚焦在客服工单闭环,不追求大而全,核心目标是减少人工介入率;Harvey 则扎根法律行业,用 Agent 完成合同审阅、法规检索,交付可复核的文档结论。

海外方案优势在于交互流畅、工具调用成熟,但大多适配轻量化、低约束的海外商业场景,面对国内物流、金融、运营商这类高并发、强服务规范、全流程可追溯的产业场景时,天然存在稳定性不足、合规审计缺失、本地化流程适配短板。

国内产业落地的核心壁垒,从来不是 " 能不能对话 ",而是 " 能不能扛住规模化生产 "。物流行业的客诉咨询、订单查询、异常理赔等场景,具备高并发、长对话、场景杂、连续性强的特点,对智能体的实时响应、语义理解、长时间对话稳定性、全链路留痕有着极高要求,通用套壳模型极易出现应答断裂、语义跑偏、时延超标等问题,无法适配常态化生产。

在头部物流企业的规模化落地中,百融智能的「硅基客服」给出了垂类岗位智能体的落地范本。该智能体正式上线后,经历了业务爬坡、高峰承压、场景迭代的完整生产验证,从 7 月上线初期单日不足 1000 通通话,稳步攀升至单日超 1.5 万通的稳定处理量级,且可支撑超长连续对话,完美适配物流行业复杂咨询、多问题串联沟通的真实场景,彻底验证了垂类岗位智能体在高并发真实生产环境中的稳定性与可用性。

这个物流落地案例,精准折射出国内企业 Agent 落地的核心逻辑:产业级智能体,必须把行业作业标准、服务规范、场景痛点前置嵌入决策与交互链路,经过真实业务峰值打磨,而非依靠实验室 Demo 参数取胜。

这也解释了垂直赛道厂商坚持自研垂类基座、深耕场景运营的核心原因——物流、金融、运营商等产业场景的规模化落地门槛,是通用 API 套壳、轻量化 RAG 改造方案无法逾越的,峰值并发稳定性、长对话准确率、全链路可追溯性,才是产业 AI 验收的核心标准。

当然,这条垂类落地路线存在清晰取舍。岗位化 Agent 深度绑定行业专属业务流程与服务规则,需要长期的场景打磨、数据迭代、业务适配,扩张速度远不如通用模型和办公智能体的轻量化复制模式。

物流场景打磨成熟的硅基客服,落地到其他行业仍需针对性重构适配,注定是重工程、重运营、慢迭代、高壁垒的长期赛道,而非短期流量生意。

03 落地瓶颈在于组织

很多人将企业 AI 落地难题简单归结为模型不够强,但产业一线的真实卡点,更多来自组织层面。AI 交付业务结果,不只是技术问题,而是人机权责、岗位流程、绩效考核的重构。

当硅基员工进入业务流程,企业要回答一系列新问题:AI 做出的初步判断,哪些环节必须人工复核?AI 的差错如何界定责任?原有团队 KPI 怎么调整,来适配人机协同的新分工?很多 AI 项目技术上线成功,最终失败,根源是组织没有配套调整,业务员工抵触、权责模糊,导致智能体无法真正进入生产链路。

技术侧的成本曲线已经明显改善:对比 2023 年,当前大模型推理成本大幅下降,模块化智能体开发框架普及,企业搭建 Agent 的工程门槛显著降低。AWS Bedrock、百度 GenFlow、百工 AgentOS 这类平台,都在降低智能体编排的开发成本。算力供给、模型工具链不再是最大瓶颈;业务指标量化、人机权责划分、全链路可信审计,才是企业 AI 规模化落地的核心瓶颈。

资本的偏好也随之改变。此前资金追逐模型参数、基础模型团队;当下投向 Agent 赛道的资金,更看重可量化落地案例、持续运营能力与商业模式。德勤 2026 企业 AI 调研显示,完成规模化 AI 部署的企业中,约三分之二获得效率与成本改善,但真正实现营收增长的企业占比仍然有限。但同时,大量只停留在演示阶段、缺少业务指标闭环的 Agent 项目,正在快速失去资本和甲方耐心。

大模型的技术红利并未消失,只是狂热期已经过去。如同 OpenAI、Anthropic 开始重新权衡前沿模型的竞速节奏,国内产业 AI 也正在告别概念狂欢,进入一个更务实的验收时代。

通用大模型会继续向上探索智能上限,而大厂鏖战的 AI 办公智能体,解决的是通用职场场景的效率提升;企业生产力的深度兑现,则更多依靠岗位化垂类 Agent。海外 Sierra、Harvey,国内深耕物流、金融、运营商的场景化厂商,共同印证同一个判断:企业采购 AI,最终买的不是模型,而是岗位上稳定交付的业务结果。

未来几年,决定企业 AI 厂商生死的,不再是发布会惊艳的 Demo,而是一套完整能力:理解岗位任务、串联业务系统、满足行业标准、核算业务收益、持续迭代运营。泡沫退潮之后,能够完成结果交付的岗位智能体,才会成为企业数字化的基础设施。

大模型退烧,不是 AI 产业的落幕,而是 AI 真正成为社会生产力基础设施的全新起点。(完)

觉得文章不错,微信扫描分享好友

扫码分享

企业资讯

查看更多内容