过去两年,大模型的竞争几乎都在云端展开:参数更大、集群更多,效果就更好。但进入2025年,一条方向相反的路线正在加速——把模型塞回手机、PC和汽车里。

为什么要把模型搬回本地

三条现实压力在推动端侧化。第一是成本,每次调用云端接口都要付费,用户规模一大,账单增长往往快于收入增长。第二是时延与可用性,语音助手、输入法补全、通话翻译这类场景,几百毫秒的往返就可能打断交互节奏,网络一差体验更糟。第三是隐私,通讯录、照片、聊天记录、健康数据,很多用户并不愿意上传。

端侧推理把这些环节留在设备内部,只把必要的结果同步出去,既省成本,也更容易获得用户信任。

三道技术坎正在被逐个解决

要在手机上跑模型,先得过了参数、内存和功耗三关。目前业界的做法已相当趋同:

由此形成的端云协同架构逐渐成为主流:简单、敏感、需要即时反馈的任务在本地完成,复杂生成与长链路推理交给云端。

落地场景比想象中更日常

真正被用户感知的端侧能力,往往不是聊天机器人。录音离线转写与摘要、通话实时翻译、相册语义搜索、输入法的上下文补全、无障碍读屏,这些功能对时延与隐私都敏感,又不需要顶级推理能力,恰好落在小模型的甜蜜区。

对硬件厂商而言,端侧能力还是差异化标签。同样的芯片,谁的模型调度更聪明、内存占用更克制,谁的续航与流畅度就更好。反过来,这也倒逼模型团队从刷榜转向抠工程:模型能不能常驻内存、会不会频繁换出、冷启动要多久,都成了硬指标。

剩下的难题

障碍依然存在。移动端内存带宽有限,模型加载与换出会造成卡顿;长时间推理带来发热和耗电,用户感知明显;芯片与推理框架碎片化,同一模型在不同平台要反复适配;端侧模型的更新也比云端麻烦,安全和合规审查链路更长。此外,小模型在长上下文与复杂推理上仍容易出错,如何判断何时该转交云端,是一道兼顾工程与体验的难题。

商业层面的问题同样现实:端侧能力难以直接收费,厂商需要想清楚它究竟是卖点、是降本手段,还是订阅服务的入口。

结语

可以预见,未来一两年手机与PC的发布会,比的将不再只是参数与跑分,而是本地到底能干什么。当模型从机房搬进口袋,衡量AI的标准也在变化:不只是榜单分数,还有响应有多快、数据留在哪里,以及一整天下来耗了多少电。