把大模型装进电脑,正在从技术展示变成一门真正的产业生意。
Gartner在2025年发布的预测中提出,2026年全球AI PC出货量将达到1.43亿台,占整体PC市场的比例接近55%;到2026年底,优先投资PC端AI能力的软件厂商占比预计将从2024年的2%提高至40%。终端硬件的算力提升,为小语言模型和本地推理提供了越来越大的运行空间。
变化也在企业侧发生。IDC在面向中国市场的2026年预测中判断,到2028年,50%的企业将把推理类应用部署到边缘侧,以支持收入增长、客户体验改善或内部流程优化。大模型应用的讨论重心,正在从“模型能做什么”转向“模型在哪里运行、以什么成本运行,以及如何进入业务流程”。
这也解释了端侧模型近期受到关注的原因。云端大模型拥有更高的通用能力上限,但在企业环境中,高频调用带来的持续费用、敏感数据传输、网络依赖和响应时延都需要纳入计算。GUI操作、语音识别、代码辅助和现场数据分析等任务,往往需要模型持续读取屏幕、声音或企业文件。模型每多执行一步,都可能增加一次云端请求和一段数据传输。
因此,端侧模型面对的问题远不止“如何把参数做小”。它还需要回答:压缩之后能否保留任务能力,设备算力能否支撑持续运行,模型如何调用软件和数据,多个Agent如何共享上下文,以及产生的结果怎样进入企业的下一步工作。模型跑起来只是起点。
从“大模型缩小”转向“能力按需组合”

在这一轮端侧AI探索中,明略科技是一家有代表性的企业。与市场上常见的单一端侧模型路径不同,明略目前对外呈现出的布局包括端侧GUI-VLA模型Mano-P、端侧语音识别模型Octo-ASR、推理加速框架Cider、Agent协作平台Octo以及AI Native硬件Octic。模型、推理、协作和硬件入口被放进了同一套技术脉络。
这套布局背后是一种不同于单纯扩大参数规模的思路。明略科技在2026年中期业绩材料中将其概括为Scaling Out:根据目标任务构建不同的专用模型,再按照业务需求组合能力,而不是试图让一个超大模型包办所有工作。公司披露,其端侧模型能力目前覆盖GUI视觉、语言和动作,图文及语音理解,代码生成、工具调用、上下文学习和认知推理等方向。
这种思路更接近企业对端侧AI的实际需求。办公软件操作需要模型识别界面和理解指令,会议场景需要处理语音和行业术语,代码开发更看重推理与工具调用。不同任务对模型的要求并不相同,与其让每个设备承载一个能力全面但运行成本较高的模型,不如围绕明确任务配置相应能力。
Mano-P提供了一个观察窗口。这是一款GUI-VLA模型,即同时处理视觉、语言和动作的智能体模型。它能够读取屏幕内容、理解任务并生成操作动作,使Agent在不依赖传统API的情况下使用桌面软件和网页系统。
据明略科技官网披露,Mano-P在OSWorld专用模型榜测试中取得58.2%的任务成功率,其4B量化版本可在Apple芯片设备上本地运行。在本地模式中,屏幕截图和任务数据留在用户设备内,也可以在断网状态下执行任务。
不过,榜单成绩不能直接等同于企业生产环境中的稳定表现。真实业务会涉及不同软件版本、权限体系、操作习惯和异常情况。Mano-P的意义更适合被理解为一次技术验证:较小尺寸的模型可以在特定能力域内处理原本高度依赖云端模型的GUI任务。
这也是明略端侧模型路线的一个特点。它没有把“小”作为唯一卖点,而是试图证明专用模型可以在目标场景中兼顾能力和部署条件。对于拥有大量内部系统、遗留软件或敏感数据的企业而言,这种能力比单纯追求模型参数更接近现实问题。
推理框架补足端侧模型的工程短板
模型能够在电脑上运行,不代表它已经具备长期工作的条件。
本地推理会受到内存容量、带宽和芯片调用效率的限制。模型响应太慢,Agent就难以连续操作;内存占用过高,则会影响设备上的其他应用。对企业来说,端侧部署的标准不是完成一次演示,而是在现有硬件上保持可接受的速度、资源占用和稳定性。
明略科技开源的Cider正是针对这一问题。Cider基于Apple MLX生态开发,对激活量化和部分张量计算路径进行优化。据公司披露,在W8A8模式下,Cider的算子速度较原生MLX提高约1.4至1.9倍,具体效果取决于Batch Size等运行条件。
这组数据的价值不只在于“更快”。它说明明略的端侧积累已经向模型底层运行环境延伸。模型决定Agent会不会做,推理框架决定它能否在终端设备上及时完成。二者需要共同适配,才能降低本地部署门槛。
从行业发展看,这类工程优化可能成为端侧模型竞争中更难被忽视的部分。AI PC的普及提供了算力,但相同硬件能承载多大的模型、响应速度如何、是否影响其他工作,仍取决于推理框架和模型优化。终端算力不会自动转化为可用的AI能力。
目前,Cider主要围绕macOS和Apple Silicon进行优化。这也构成其现阶段的边界。企业终端还包括Windows PC、移动设备、专用硬件和多种芯片平台。明略端侧技术栈后续能否获得更广泛应用,跨平台适配能力会是重要观察指标。
Agent协作让端侧模型进入企业流程
端侧模型还有一个容易被忽略的问题:单个模型即使在一台设备上表现良好,也可能只是一个孤立工具。
企业任务通常需要跨人员、跨软件和跨时间推进。一个Agent负责理解会议内容,另一个查找资料,还有Agent执行系统操作、复核结果。模型在本地完成任务后,结果还需要进入组织的知识库、协作工具和业务系统。如果缺少协作层,端侧模型很容易停留在个人效率工具阶段。
明略科技开源的Octo承担了这部分连接工作。按照官方介绍,Octo通过Bot、Channel、Thread和Loop等机制,为不同Agent提供身份、上下文共享、任务编排和过程记录。Mano系列负责本地感知和操作,Cider提高推理效率,Octo则把不同能力接入组织工作流。
硬件端的Octic进一步补充了线下信息入口。这款可穿戴录音设备将会议和沟通内容转化为Agent可处理的上下文,再与Octo协作网络连接。在2026全球人工智能终端展期间,明略科技副总裁孔誉乾将AI硬件概括为线下“Context Gateway”,即上下文入口。其核心逻辑是让会议和现场沟通中的信息进入后续任务,而不是停留在一份会后纪要里。
从这些产品之间的关系看,明略试图解决的是一条更长的链路:端侧模型负责感知和执行,推理框架管理本地算力,硬件采集现场信息,Agent平台承接协作和任务流转。端侧AI由此不再只是“电脑里运行了一个模型”,而是逐步进入企业数据、知识与工作流程。
这种路线与明略长期服务企业客户的经历有关。明略科技成立于2006年,业务长期覆盖营销、消费、零售和企业数据智能等场景。与纯模型公司相比,其优势更可能来自对企业流程、数据结构和交付条件的理解,而不是某一个阶段的参数竞赛。
端侧AI正在进入系统竞争阶段。模型能力固然重要,但越来越难独立决定产品成败。推理效率、数据边界、软硬件适配、Agent协作和现场交付,共同决定一项技术能否从榜单走到生产环境。
从布局角度看,明略科技已经将端侧模型、推理框架、协作平台和硬件入口连接起来。对于这家公司而言,下一步需要证明的已不是“有没有端侧模型”,而是这套组合能否在更多企业工作流中稳定运行,并把响应速度、数据控制和计算成本转化为客户可以验证的结果。
