当AI开始“替你做事”,Token消耗会发生什么?
过去几年,AI产业最热闹的故事,是模型。
参数从亿级走向千亿级,训练集群不断扩大,全球算力投资持续升温。行业不断追问:谁拥有更大的模型?谁拥有更强的算力?
但随着AI从“会回答问题”走向“替人完成任务”,另一个问题正在浮出水面:
如果未来每个人、每台设备、每个智能体都在持续调用AI,谁来为越来越多的Token买单?
这可能才是AI进入下一阶段之后,真正的商业命题。
AI的下半场,正在从训练走向推理
训练时代,AI算力需求集中在少数大型数据中心。
但推理时代完全不同。
手机需要AI,汽车需要AI,家庭设备需要AI,机器人需要AI,工业设备同样需要AI。
模型训练可以集中进行,但推理将发生在千千万万个真实场景中。
尤其当Agentic AI开始普及,AI的使用方式也会发生变化。
过去,用户问一个问题,AI回答一次。
未来,用户只需要提出一个目标,AI就可能自动完成信息检索、工具调用、任务规划、环境感知和执行。
AI从“被动回答”,变成“持续工作”。
这意味着Token消耗也可能从偶发调用,变成持续发生。
当AI开始“替你做事”,Token消耗会发生什么?
想象一下未来的智能终端。
你说一句“我要回家了”,AI可能需要查询天气、判断交通、规划路线、调整车内环境,甚至提前打开家中的空调。
对于用户来说,这只是一个指令。
但对于AI来说,背后可能对应着多次推理、工具调用和系统交互。
当Agent从“聊天工具”变成“全天候助手”,AI推理就不再是偶尔发生的行为,而会变成一种持续存在的基础设施需求。
于是,一个此前没有那么突出的问题开始变得重要:
AI越聪明,运行它的成本是否也会越来越高?
AI普及之前,还有“三怕”
当AI真正进入真实生活,用户真正关心的未必是模型参数有多大,而是三个更加现实的问题:
怕贵、怕慢、怕泄露。
怕贵,决定AI能不能从尝鲜走向日用。
怕慢,决定AI能不能真正承担实时任务。
怕泄露,则决定AI能不能进入企业、家庭以及更多高价值场景。
这三个问题,看似属于用户体验,实际上都在推动同一件事:
让更多AI推理发生在离用户更近的地方。
端边AI不是云端AI的替代品
这并不意味着云端AI会消失。
恰恰相反,云端仍然需要承担复杂模型、复杂任务以及大规模计算。
但越来越多适合本地处理的任务,可以通过端侧和边缘侧完成。
于是,未来的AI基础设施可能不再是单纯的“云端模式”,而是:
云端负责复杂推理,边缘负责协同,终端负责即时响应。
这样做的意义,不只是减少网络往返。
更重要的是,它同时触及AI普及最核心的三个变量:
成本、延迟和隐私。
AI真正普及,需要先解决“跑得起”
AI真正进入千家万户,不可能只依靠越来越大的模型。
它还需要越来越高效的芯片、越来越成熟的软件栈,以及能够让AI在有限功耗、有限内存和有限连接条件下稳定运行的系统能力。
围绕这一方向,紫光展锐正在布局Agentic AI技术方案、N9系列端边AI芯片平台与UniClaw智能体,尝试把AI能力进一步下沉到终端和边缘。
据展锐披露,通过架构优化与动态任务管理,UniClaw针对不同使用场景可节省30%到90%的Token消耗;通过内存与进程优化,最低内存需求可达到50M。
这些能力所指向的,并不是简单地让AI“跑在设备上”。
而是让AI在真实终端环境中,以更低的成本、更低的资源占用和更稳定的体验持续运行。
从Token经济走向Token普惠
回到最开始的问题。
AI的下一阶段,真正需要解决的可能不是“模型还能做多大”,而是:
模型如何进入更多设备,并且长期、低成本地运行。
从这个角度看,端边AI并不是云端AI的替代品。
它更可能是Token经济走向普惠的基础设施。
AI真正普及的标志,不是人人都能使用最大的模型。
而是人人都用得起AI。