27B 压进 3.9GB 的真相:端侧模型过了“跑得动“这关,但“用得值“呢
2026/9/3 16:11:47 网站建设 项目流程

凌晨刷 Hugging Face 的时候,看到 Liquid AI 今早新放的 LFM2.5-1.2B Thinking——一个 900MB 左右、号称"先思考后回答"的端侧推理模型,直接往智能手机里塞。往下翻两页,又是 PrismML 那个 Bonsai 27B,把基于 Qwen 的 27B 模型压到 3.9GB,一样在手机内存预算里跑。最近这个月,这种"端侧跑大模型"的新闻几乎每周来一条,从 Bonsai 到 MiniCPM5 再到各种 1B/2B 小模型,流量一个比一个响。可我不太想跟着喊"DeepSeek 时刻"。我更好奇的是,这些数字背后到底有多少是能用的,有多少只是发了个 Show。

先把确定的摆清楚。Bonsai 27B 用的是阿里通义千问 Qwen3.6-27B 做底子,出了两个变体:一个叫 Ternary,5.9GB,每个权重约 1.71 bit,定位笔记本;另一个 1-bit 版 3.9GB,每个权重约 1.125 bit,专门放手机。往细了算,27B 模型按照比特直接存,16-bit 要 54GB,就算 4-bit 量化也压到 18GB——手机显然装不下。它靠的是把权重压到接近 1 bit,官方说 1-bit 版在 15 项基准上保住了全精度大概 90% 的水平,数学和写代码这俩几乎不掉。听起来很美。但你先别急着下单买推理卡,接着往下看。

真正让我留个心眼的是那块降幅。Bonsai 官方自己也承认,Agentic 工具调用那个维度,1-bit 版掉了大概 17.5%。Hacker News 上有人实际跑,说在真实的工程场景里这个差距会被放大得更凶。翻译成人话:你让它算个题、写段代码,它装得挺像回事;可你要它自己规划、调工具、来回好几步把一件事串起来,量化砍掉的那层精度就开始咬人了。端侧模型这几年解决的其实是同一件事——把"跑不跑得动"(内存、显存、功耗)的物理限制往前推。这是真本事,不是营销。可"跑得动"和"干得好"是两码事,尤其是当任务从"一顿出一句话"变成"一个 Agent 要连续调用几十上百次工具"的时候。Liquid AI 自己也承认这类模型适合数据提取和工具调用,不适合复杂推理——这话放在 PPT 上没人会写,但写程序的都懂。

所以我觉得,这一轮端侧模型的看点,根本不在"又多塞进去几个亿的参数",而在它倒逼出来的两件事。

第一件是取舍终于被摆上台面了。过去云端大模型把"又大又准"当默认值,端侧一上来就被迫回答一个问题:为了在本地跑,我愿意损失多少精度?Bonsai 用 1-bit 换 90% 的综合能力,但 Agent 维度单独掉了近两成——这说明一个很扎心的事实:量化对不同能力的伤害是非均匀的,推理类任务扛得住,Agentic 那种多步编排的扛不住。你如果在做一个端侧 Agent 应用,GPQA 跑分漂亮没用,你要盯的是它在你的工具链里打几折。这个"打折不同步",才是真实的工程约束,而不是发布会上那行大大的 90%。

第二件是端和云终于开始分工了,而不是硬碰硬。阶跃星辰的 Step Edge 系列、Liquid 这波,其实都在讲同一套话术:能本地跑的简单高频任务,就乖乖在本地跑,0.1 秒出结果、数据不上云、隐私也护住;一遇到复杂推理,直接丢回云端。这套"端云协同"听着像外包甩锅,但细想是对的——端侧模型的物理天花板就摆在那,你让它硬啃长逻辑,不如让它当个"快而专"的前台,把重活分给后面的大模型。我挺认同这个思路,但它带来的运维复杂度比想象中大:什么时候该触发云端、切换时延怎么兜底、数据分级怎么划,这些都要你亲自踩一遍。这是我目前最想劝同行先别上头的地方——端侧不是"装上模型就完事",是做一轮新的架构拆分。

再往后顺一程,我觉得端侧真正的爆发点不在参数,在场景。900MB 的模型能塞进手机、1B 的模型能跑在树莓派上,意味着很多过去想都不敢想的体面场景开始成立:车机上那句"帮我导个航"不用联网卡半天,办公软件里本地总结一份几十页的文档不用往云端传,甚至离线环境下给设备加一点"会思考"的能力。这也是为什么我看到 MiniCPM5 那种把 INT4 压到 0.5GB 的小模型会觉得挺有价值——它不跟云端的巨人拼"谁更博学",它拼的是"在没网的时候、在偷偷算的时候、在你的数据不出设备的时候",能不能把事办得差不多。窄,但真实。

可越是这样,我越想追着问一句:当所有模型都能被压进手机、当端侧跑 27B 变成标配,那"量化能力"本身还会是护城河吗?如果 Bonsai 这种把权重打到 1 bit 的做法大家都能抄,决定差异的会不会又回到数据、回到后训练、回到 Agent 编排那套老东西?端侧模型在手机里跑和云端模型在机房跑,最后拼的到底是压缩技术,还是别的什么?

题目我不会下死结论。我只说一路看下来,端侧这条线终于让我有了"从 PPT 拽进现实"的实感,但它的坑,远比发布会 road map 上画的多。你手上那个端侧项目,是打算把 Agent 整套搬本地,还是只敢拿它做快而稳的前台?压到 1 bit 那 18% 的能力折损,你愿意为谁的隐私买单埋单?评论区聊聊,我挺想听听你的衡量标准。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询