几乎每家AI大厂都在让AI获得“操作电脑”的能力。OpenAI从Operator一路推进到Computer Use,Claude、Gemini也在向桌面、浏览器和应用环境深入。问题是,当AI从聊天框走进真实设备,决定体验的就不再只是模型有多聪明,而是它能不能看懂屏幕、听懂用户、调用软件,并在有限的设备算力里稳定地把事情做完。
这也是明略科技持续布局端侧AI的原因之一。从Mano-CUA,到端侧语音识别模型OctoASR,再到Apple Silicon推理加速框架Cider,以及人与Agent协作平台的Octo,明略科技实际上在沿着一条比较完整的链路推进:让AI看得懂设备、听得懂用户、跑得起来,最后还能把不同AI组织起来一起干活。这背后对应的,也不只是一次模型部署方式的变化。手机和PC正在获得越来越强的AI算力,而Agent又把AI从“回答问题”推向“持续执行任务”。
01 端侧AI机遇来自哪里
AI手机和AI PC其实已经讨论了好几年,如今硬件的AI能力正在快速普及,而Agent又把AI推向了更需要设备参与的任务,两条线恰好在这个时间点汇合。先看硬件。Gartner预计,AI PC占全球PC市场的比例将从2024年的15.6%提升到2026年的54.7%,AI笔记本在2026年的占比预计达到58.7%。Counterpoint则预计,具备生成式AI能力的智能手机将占2026年全球手机出货量的45%,2027年进一步升至52%。端侧AI从高端设备上的附加能力,正在逐渐变成主流终端的标配。芯片和设备已经把舞台搭好了,真正的问题变成了AI究竟能在这台设备上做什么。Agent恰好把这个问题推到了前台。如果AI只是聊天,云端模型已经可以解决大量需求;但当AI开始操作浏览器、调用应用、处理文件,甚至连续执行一两个小时的任务,设备就不再只是一个显示结果的屏幕。OpenAI的Computer-Using Agent已经可以通过理解截图、鼠标和键盘完成多步骤电脑任务;Google推出Windows版Gemini,也开始把AI更直接地放进桌面工作环境。所以,端侧AI真正被重新重视,并不只是因为手机和PC多了一块NPU,而是Agent开始需要进入“工作现场”。设备里的屏幕、文件、麦克风、应用和当前操作状态,都是云端模型无法天然持续拥有的信息。AI一旦要从“告诉你怎么做”变成“替你做完”,它就必须越来越靠近这些信息发生的地方。
02 端侧AI走到了哪一步
如果按照最终交付的结果来看,端侧AI大致经历了三个阶段。第一阶段解决的是能不能跑。模型需要从几十亿、上百亿参数不断压缩到更适合设备的规模,同时适配NPU、GPU、内存和功耗限制。这个阶段的核心是模型量化、蒸馏、算子优化和推理框架,目标很朴素:让模型从服务器进入一台真实设备。第二阶段解决的是有没有用。语音识别、图像理解、摘要、翻译等能力开始成为具体产品功能,端侧模型不需要包打一切,而是在某一个任务上做到足够快、足够稳定。第三阶段是能不能交付可靠的结果。AI需要理解屏幕,调用不同应用,读取本地信息,执行连续操作,还要能够处理任务中途出现的变化。到了这一步,端侧AI的难题也从一个模型问题,变成了一整套系统问题。模型要足够小,但不能因为变小而失去完成任务所需要的能力;推理要足够快,否则Agent每点一下、等几秒钟,整个任务就会变得不可用;数据要能够留在本地,但又不能让本地模型因为Context不足而变“笨”;单个Agent还不够,它还得能够调用其他Agent和工具。

03 明略科技的解法:把AI嵌进企业真实工作的系统
明略科技目前在端侧AI有一系列布局:模型层,Mano-CUA让AI理解和操作电脑GUI;OctoASR是一款0.8B端侧语音识别模型,可在macOS本地完成音频解码和转写;引擎层,Cider针对Apple Silicon进行推理优化,让模型能够更高效地利用设备侧算力;再往上一层,Octo则负责把不同Agent组织起来,形成跨平台、跨Runtime、跨Agent的协作网络。这几个环节放在一起,Mano-CUA解决“AI怎么动手”,OctoASR解决“AI怎么听”,Cider解决“AI怎么跑”,Octo解决“这些AI怎么一起干活”。它们共同指向的,其实是同一个问题:怎么把一个模型能力,真正变成设备上的工作交付能力。
这条链也对应着三笔比较现实的商业账。第一笔是推理成本账。对于会议转写、客服辅助、终端办公等高频任务,完全依赖云端意味着每一次调用都会产生持续的推理和网络成本。端侧并不会让AI“零成本”,但可以把一部分计算放到设备侧,同时减少网络往返和云端调用。
第二笔是数据和信任账。金融、医疗、制造等行业并不是所有数据都适合上传到云端处理。OctoASR把语音转写放在本地,Octo又支持私有化部署,这种组合的意义在于,企业可以把一部分敏感数据和Agent运行环境控制在自己的边界内。
第三笔是交付账。企业真正需要的通常不是一个万能模型,而是针对具体任务组合出一套能力:某些任务需要视觉理解,某些需要语音,某些需要调用企业知识库,另一些则需要复杂推理。模型、推理引擎和Agent协作层如果能够组合起来,AI交付就有机会从“买一个模型”转向“配置一套能力”。
04 端侧AI未来的延展空间
如果说前一阶段的端侧AI主要在解决“模型怎么跑”,下一阶段更值得关注的,是设备如何成为Agent的Context入口。端侧AI的核心资产可能逐渐从“本地运行一个模型”,变成掌握足够多的Context。更进一步,端侧AI和操作系统之间的关系也可能发生变化。过去操作系统负责管理应用,用户自己决定打开哪个App、点击哪个按钮;Agent时代,用户可能只需要表达目标,Agent负责决定调用哪个应用、哪个模型以及哪一种能力。
对明略科技来说,端侧AI的未来趋势也让现有布局有了更大的延展空间。Mano-CUA对应设备感知和执行,OctoASR对应本地语音入口,Cider对应端侧算力效率,而Octo所解决的Agent协作,则有机会把这些分散的端侧能力与云端模型、企业系统连接起来。
