本周至少四家厂商发布了面向端侧的大模型工具包,覆盖手机、PC 与边缘设备。共同卖点是数据不出设备、支持完全离线运行,以及针对低内存环境的量化方案。

实际表现

根据厂商公布的数据,14B 量化模型在旗舰手机上的生成速度约为每秒 25 个 token,内存占用控制在 6GB 以内;3B 级别模型则可以在两年前的设备上流畅运行。

开发者的选择增多

工具包普遍提供统一的推理 API 与模型压缩脚本,部分还内置了针对隐私场景的本地向量检索方案。这意味着开发者可以在不搭建服务器的情况下,构建完整的本地知识库应用。

行业观察认为,端侧与云端的混合架构将成为未来一年的主流形态:敏感数据走本地,重计算任务走云端。