Bonsai 2 27B 实测8G显卡真跑起来了附厂商没有的速度数据这几天这个模型到处都是27B 的模型压到 5.9 GB厂商说保留了 98.2% 的能力RTX 5090 上跑到 143 tok/s。两天下载量 40 万。我一开始是被一个词搞住的。有人说它是三进制有人说是三值量化我看了半天没搞清这俩是不是一回事。后来查明白了正确的说法是三值网上写三进制的是 ternary 一词多义串台了数学里的 ternary 指三进制记数法苏联 Setun 那种LLM 里的 ternary 指权重只能取三个值。两边都用到 -1、0、1 这三个符号所以混了。然后我注意到一个更实际的问题厂商那张速度表里一张 8GB 显卡都没有。5090、RTX 6000 Ada、4090、L40S、H100、A100、L4、M5 Max、M5 Pro都是 24GB 起步的卡和苹果新芯片。而本地玩家手里占大头的恰恰是 3070、3060 这批 8G、12G 的老卡。所以我把 5.9 GB 的那个版本下下来塞进了我的 RTX 3070 8GB。一、Bonsai 2 27B 到底做了什么事简单说就三步拿阿里的 Qwen3.8-27B27.36B 参数原本 FP16 要占 54 GB 左右当底子架构一行没改。把每个权重从浮点数改成三个值之一-1、0、1。再给每 128 个权重配一个 FP16 的缩放系数把数值大小找回来。打包成 GGUF落盘 5.95 GB。那个1.72 bit是这么来的这笔账大部分稿子没算给你看三个状态的信息量 log2(3) 1.585 bit 每128个权重分摊1个 FP16缩放系数 16÷128 0.125 bit 1.710 bit 不到 0.1% 的张量必须留高精度循环状态、归一化层 1.72 bit实测均值出两个打包文件装的是同一份权重只是打包方式不同文件位宽大小说明PTQ1_01.75 bit/权重5.95 GBtrits 紧密打包省地方PQ2_02.13 bit/权重7.21 GB每个权重占 2-bit 槽解包省事多数新卡上更快8GB 卡其实没得选。只有 5.95 GB 那个塞得进去。顺带说清一件事它跟微软的 BitNet 不是一条路。BitNet 是从头训练时就按三值约束去训代价高Bonsai 2 是拿已经训好的Qwen3.8-27B 做事后三值化本质是后处理。有稿子写它从头训练那个说法不对。许可 Apache 2.0能商用。二、我的 RTX 3070 8G把它跑起来了先说结论跑起来了而且不用把层卸载到内存64 层全在显卡上。机器配置RTX 3070 8GB / R9-7900 / 64GB DDR5 5200。启动命令这行可以直接抄llama-server.exe -m ”D:\AI_Models\Ternary-Bonsai-2-27B-PTQ1_0.gguf” -ngl 99 -fa on -c 16384 --parallel 1 --cache-type-k q8_0 --cache-type-v q8_0 --host 0.0.0.0 --port 8080几个参数的白话版-ngl 99所有层都丢给显卡算别让 CPU 掺和-c 16384上下文给 16K--parallel 18G 卡的保命参数。默认开 4 个槽会多占好几个 G直接爆--cache-type-k/v q8_0上下文缓存用 8 位存省显存-fa on闪存注意力省显存⚠️ 一个前提必须换 llama.cpp。厂商原版跑不了这个文件得用 PrismML 自己的分支我这个版本是 build 10709。原因后面那期细说这里先记一句用原版跑7.21 GB 那个文件会被拒绝加载5.95 GB 那个会静默加载然后吐乱码。后者更坑因为它不报错。显存实测占用约 6 GB。8G 卡还剩两个 G。三、38 tok/s放在厂商那张表里是什么位置这是这次重点想补的数据。稳态生成速度38 tok/s。具体几次跑下来是 38.14 到 38.56长任务随着上下文变长会掉到 3436。把它放进厂商那条刻度尺里都用 PTQ1_0 打包、都是生成速度显卡生成速度来源RTX 5090120.5 tok/s厂商RTX 409091.1 tok/s厂商H100 SXM86.9 tok/s厂商A100 SXM54.7 tok/s厂商我的 RTX 3070 8G38.x tok/s本次实测L472W 亮机卡32.1 tok/s厂商RTX 3060 12G约 30 tok/s第三方实测看出来什么大约是 4090 的 42%比同为 812G 档的 RTX 3060 12G 快约 27%位置卡在 A10054.7和 L432.1之间⚠️ 关于口径厂商宣传里常见的5090 上 143 tok/s和上表的 120.5 tok/s是两套测法不是数据打架。上表统一用 llama-bench 口径128 token 生成、深度 0、batch 1、PTQ1_0 打包我这边也是同一套口径所以能直接比。跨口径比速度是很容易翻车的地方这也是我把厂商表里那列数字重列一遍的原因。还有一个数但我得把它说准读 prompt 的速度波动很大从 29 到 264 tok/s 都有。原因出在这儿读得快不快读得快不快跟这次有多少内容能命中上一轮的缓存复用直接相关。我这几次里长 prompt132371 token能跑到176264 tok/s短 prompt1653 token算出来只有 2978 tok/s真因是固定开销被摊到几个 token 上把平均值拉下来了。所以结论只有一句让它读长文档是不痛苦的痛苦的是等它一个字一个字往外吐。顺带辟一个直觉三值模型不吃模型越小越快那套估算。厂商数据里5090 上 5.95 GB 的权重按显存带宽本该跑到 300 tok/s实测只有 120因为瓶颈是解包三值权重所需的计算指令不是搬运数据的速度。你要是拿体积除以带宽去估它会高估一倍。四、为什么 5.9GB 的模型显存只占 6GB这条是这篇重点想讲清楚的事也是它能塞进 8G 卡的真正原因。5.9 GB 是硬盘上的文件大小不是它运行时要的显存。正常的模型权重之外还要给上下文缓存留地方就是模型记住你前面说过什么的那块内存它会随着你聊得越长而越长。厂商数据这个模型开满 262K 上下文f16 缓存要22.9 GB。我的 8G 卡开 16K 只用 6 GB多出来的那一丁点是哪来的靠的是它的架构混合注意力。64 层里大约 75% 是线性注意力层只有约 25% 是全注意力层。人话版大部分层用的是一种不用记住每一个历史 token的算法几乎不吃上下文缓存真正吃缓存的只有那十几层。所以上下文涨到 16K缓存也没涨多少。这就是为什么同样是 27B别的模型在 8G 卡上连门都进不去它能进去。但也要说清楚代价厂商标的 262K 上下文在 8G 卡上是纯纸面数字。我这边 16K 是稳的q8_0 缓存再往上要换更小的缓存类型速度也要打折。想跑满 262K你还是需要一张大卡。五、它真能干活写作和数学都过了跑分是跑分我用自己会碰到的活试了两项。写作。我让它以文学系大学生的水平写一篇 800 字的异乡人思念陕南秋天。出来的东西我贴一段陕南的秋天不是落下来的是沉下来的。汉江上的雾先起来一层一层像谁在江面上拉了一张白桌布。然后山里的叶子才慢慢变色不是北方那种一刀就红到发烈的样子是绿的、黄的、褐的混在一起像一桌没吃完的菜。我奶奶家的院墙在晒柿子。一排一排挂上去红得像一嘴一嘴的皮上带着薄薄一层霜。……我那时大概十三四岁每天放学回来看那墙柿子哪颗最软就掰哪颗。不急着咬先拿指甲在皮上刮一下汁水顺着指缝流出来甜酸有点涩。就像你站在河边水在你脚边流过你认得出那是汉江的水——但够不着。这个水平我给过。有具体的感官细节不堆形容词收得住。当然那句“红的像一嘴一嘴的”实在是没崩住。数学。一道带矛盾条件的四色花园题对角守恒 相邻差值 ≤7 总数 100 已知红色 28它一步步推答案正确验证也完整。这两项加起来能说明一件事日常会碰到的活这个 6GB 的 27B 扛得住。六、一道让它跑了 8 分钟、一个字都没写的题然后我给了它一道代码题。题目是这样的写个 Python 函数找出列表里出现次数为奇数的元素要求不能用额外数据结构、时间 O(n)、空间 O(1)然后回答这些要求能不能同时满足如果不能就证明为什么。结果数字生成了16210 个 token花了469.7 秒7 分 50 秒结束方式撞到 16K 上限被硬截断正式答案零那个输出文件我看了59K 字符几乎都是思考过程思考块结束标记后面是空的。它连一个字的正式答案都没开始写。思考收尾时硬断在半句话上。有个细节特别有意思它在思考的前 200 个 token 就把答案想出来了原话大意是返回所有和返回任意一个这两句要求互相矛盾应该指出这一点。然后它没停自己给自己开了个更难的子问题如果只要求返回任意一个O(n) 加 O(1) 到底可不可能一路钻到向量空间、位运算、算法验证直到把自己绕进去、撞在上下文上限上。这里我要替它说一句公道话这不代表它 coding 不行。厂商数据里它的编码是强项HumanEval 95.12比满血版的 93.29 还高。问题出在这道题的性质上它要的是证明这个要求本身能不能成立没有天然的收敛点得靠模型自己判断我想够了。而它恰恰缺这个判断。所以更准确的分类是封闭题有明确答案的数学 ✅、写作 ✅开放/陷阱题要自己判断何时收手的❌ 陷进去了为什么以及怎么治我放到下一期因为解法我找到了而且是一行参数的事。七、现在能下的结论先把这期能定的部分定下来8G 卡真能跑而且不用卸载到内存全 64 层上显卡稳态 38 tok/s显存占约 6 GB。能塞进去靠的是混合注意力约 75% 层不吃上下文缓存不是靠三值本身省显存。三值省的是硬盘空间和每个 token 的计算量。日常活扛得住我试的写作和数学都过关写作那篇质量是真的好。262K 上下文在 8G 卡上是纸面参数16K 是稳的。更大的隐藏成本落在工具链上。你得换掉正在用的 llama.cpp。三值这条路我觉得是真有东西的它跟常规 2-bit 不一样的地方在于常规量化是尺子刻度变粗还能读数三值是把尺子换成三个档位的开关。厂商数据里常规 2-bit 在 AIME26 上从 94.58 塌到 57.50它在同一题上是 95.83这就是那条低比特会选择性崩塌的路线它绕过去了。当然98.2% 是厂商自己的数第三方还没复现完长程任务那部分还另有一笔账。下期说两件事那道跑满 8 分钟的题我用一行参数让它 4 分钟交了卷以及这个方案本身有哪些还没解决的问题。本文数据均来自本人机器实测速度对照中的厂商数字引自 PrismML 模型卡llama-bench128 token 生成深度 0batch 1第三方数字引自公开实测。更新相关实测可以关注同名GZH获取。
企业数字化 ERP 产品动态
相关推荐
飞腾D2000硬件设计避坑指南:DDR/PCIe/RGMII等关键接口布线规范 简介:本资源是飞腾腾锐D2000芯片的官方硬件设计指导手册V1.3(2023年4月发布),面向嵌入式硬件工程师、板级开发人员及国产化平台系统设计师,解决基于D2000芯片开展原理图设计、PCB布局与信号完整性验证等核心工程问题。… · 2026/9/24 23:09:39
司法文本相似匹配:双塔BERT微调实战与法研杯高分方案 简介:本资源是中国法研杯司法人工智能挑战赛‘相似案例匹配’赛道冠军方案的完整技术实现,面向法学与人工智能交叉领域的研究者、算法工程师及高校相关专业学生,聚焦司法场景下法律文书语义匹配这一核心任务。压缩包共28个文件,含… · 2026/9/24 23:09:33
CIDR核心指南:从/24概念到子网划分与路由聚合实践 你平时查 IP 地址的时候,肯定见过192.168.1.100/24这种写法。/24是什么?为什么要这么写?它跟传统的子网掩码255.255.255.0是什么关系?如果你刚开始学网络协议,很容易被这一串数字绕晕。这篇学习笔记是我重新梳理CIDR&a… · 2026/9/24 23:09:33
Python %-formatting 完全指南:从基础语法到避坑实战 如果你在Python代码里看到%s、%d、%(name)s这些写法,那它就是在用 %-formatting。这是Python里历史最悠久的一种字符串格式化方式,比f-string早了差不多二十年。很多新教程都在推f-string,但我在维护老项目和读第三方库源码时,遇到… · 2026/9/24 23:56:09
FPGA嵌入式数据处理实战:从UART接收到均值滤波的完整设计 简介:这份PDF文献围绕FPGA嵌入式数据处理技术展开,适合从事数字信号处理、硬件开发及嵌入式系统研究的工程师和研究生参考。资源为单独1个PDF文件,大小约1.48MB,目前已有85人浏览学习。文中以Xilinx XC5VFX70T为处理器核心&#x… · 2026/9/24 23:56:09
树莓派串口全解析:UART/SPI/I²C物理层、协议层与系统层三维认知 1. 为什么“认识树莓派各串口”是每个动手者绕不开的第一课刚拿到树莓派,很多人第一反应是插上电源、接显示器、装系统、跑个Hello World——这没错,但真正拉开能力差距的起点,往往藏在那几组标着“GPIO”字样的小针脚里。尤其是当你想接一个… · 2026/9/24 23:56:09
LeetCode刷题指南:模式识别、经典题解与高效路线 在社区里经常看到两类人:一类是刚注册 LeetCode,打开题库却不知道从哪里下手,收藏了一堆刷题路线帖,结果还是没坚持下来;另一类是已经刷了三百多题,但面试时题目稍微拐个弯就卡壳,甚至开始怀疑自… · 2026/9/24 23:56:09
CL57C闭环步进驱动深度解析:编码器反馈与实时PID校正 简介:本资源是CL57C闭环步进驱动器的官方中文使用说明书,面向自动化控制工程师、机电一体化技术人员及高校相关专业实践者,解决闭环步进系统安装、调试、运行与故障排查等核心实操问题。文档全面覆盖系统简介、电源与通信接线规范、初始化参数… · 2026/9/24 23:56:09
多Agent系统从Demo到生产:架构设计与治理体系落地指南 多agent系统这两年从论文里的概念一路杀到生产环境,我身边不少团队都在做,但真正跑通并且能长期维护的并不多。大部分项目卡在同一个地方:demo阶段几个agent互相调用看起来很美好,一旦接入真实业务、并发上来、需求变更࿰… · 2026/9/24 23:56:03
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程 简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13
1D-CNN时间序列建模实战:从Conv1d原理到工业落地 简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26
柔软的L:汉语语流中被忽视的舌肌张力控制 1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44