AI下半场,谁来为越来越多的Token买单

互联网
2026
09/18
15:03
分享
评论

过去几年,AI产业最热闹的故事,是模型。

参数从亿级走向千亿级,训练集群不断扩大,全球算力投资持续升温。行业不断追问:谁拥有更大的模型?谁拥有更强的算力?

但随着AI从“会回答问题”走向“替人完成任务”,另一个问题正在浮出水面:

如果未来每个人、每台设备、每个智能体都在持续调用AI,谁来为越来越多的Token买单?

这可能才是AI进入下一阶段之后,真正的商业命题。

AI的下半场,正在从训练走向推理

训练时代,AI算力需求集中在少数大型数据中心。

但推理时代完全不同。

手机需要AI,汽车需要AI,家庭设备需要AI,机器人需要AI,工业设备同样需要AI。

模型训练可以集中进行,但推理将发生在千千万万个真实场景中。

尤其当Agentic AI开始普及,AI的使用方式也会发生变化。

过去,用户问一个问题,AI回答一次。

未来,用户只需要提出一个目标,AI就可能自动完成信息检索、工具调用、任务规划、环境感知和执行。

AI从“被动回答”,变成“持续工作”。

这意味着Token消耗也可能从偶发调用,变成持续发生。

当AI开始“替你做事”,Token消耗会发生什么?

想象一下未来的智能终端。

你说一句“我要回家了”,AI可能需要查询天气、判断交通、规划路线、调整车内环境,甚至提前打开家中的空调。

对于用户来说,这只是一个指令。

但对于AI来说,背后可能对应着多次推理、工具调用和系统交互。

当Agent从“聊天工具”变成“全天候助手”,AI推理就不再是偶尔发生的行为,而会变成一种持续存在的基础设施需求。

于是,一个此前没有那么突出的问题开始变得重要:

AI越聪明,运行它的成本是否也会越来越高?

AI普及之前,还有“三怕”

当AI真正进入真实生活,用户真正关心的未必是模型参数有多大,而是三个更加现实的问题:

怕贵、怕慢、怕泄露。

怕贵,决定AI能不能从尝鲜走向日用。

怕慢,决定AI能不能真正承担实时任务。

怕泄露,则决定AI能不能进入企业、家庭以及更多高价值场景。

这三个问题,看似属于用户体验,实际上都在推动同一件事:

让更多AI推理发生在离用户更近的地方。

端边AI不是云端AI的替代品

这并不意味着云端AI会消失。

恰恰相反,云端仍然需要承担复杂模型、复杂任务以及大规模计算。

但越来越多适合本地处理的任务,可以通过端侧和边缘侧完成。

于是,未来的AI基础设施可能不再是单纯的“云端模式”,而是:

云端负责复杂推理,边缘负责协同,终端负责即时响应。

这样做的意义,不只是减少网络往返。

更重要的是,它同时触及AI普及最核心的三个变量:

成本、延迟和隐私。

AI真正普及,需要先解决“跑得起”

AI真正进入千家万户,不可能只依靠越来越大的模型。

它还需要越来越高效的芯片、越来越成熟的软件栈,以及能够让AI在有限功耗、有限内存和有限连接条件下稳定运行的系统能力。

围绕这一方向,紫光展锐正在布局Agentic AI技术方案、N9系列端边AI芯片平台与UniClaw智能体,尝试把AI能力进一步下沉到终端和边缘。

据展锐披露,通过架构优化与动态任务管理,UniClaw针对不同使用场景可节省30%到90%的Token消耗;通过内存与进程优化,最低内存需求可达到50M。

这些能力所指向的,并不是简单地让AI“跑在设备上”。

而是让AI在真实终端环境中,以更低的成本、更低的资源占用和更稳定的体验持续运行。

从Token经济走向Token普惠

回到最开始的问题。

AI的下一阶段,真正需要解决的可能不是“模型还能做多大”,而是:

模型如何进入更多设备,并且长期、低成本地运行。

从这个角度看,端边AI并不是云端AI的替代品。

它更可能是Token经济走向普惠的基础设施。

AI真正普及的标志,不是人人都能使用最大的模型。

而是人人都用得起AI。

THE END
广告、内容合作请点击这里 寻求合作
免责声明:本文系转载,版权归原作者所有;旨在传递信息,不代表砍柴网的观点和立场。

相关热点

相关推荐

1
3