whichllm 完整指南3 步选对能跑进你显卡的本地 LLM【免费下载链接】whichllmFind the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly.项目地址: https://gitcode.com/GitHub_Trending/wh/whichllm24G 显卡装得下 70B但真跑起来 2 t/s 根本没法看参数大不等于能用。whichllm 一条命令扫完你的显存、内存和带宽按实时基准分排出真正能跑、还够快的本地 LLM把能跑和跑得快一起锁死。3 步先跑起来不用 clone、不用配环境敲 3 条命令就能出结果。装包pip install whichllm需要 Python 3.11 以上。直接跑whichllm它自动识别你的 GPU/CPU/内存吐出一张按基准分排序的推荐榜默认就带显存、速度、适配方式这几列。不买卡先试whichllm --gpu RTX 4090把目标显卡塞进模拟器先看看能跑多快。第一次跑会从 HuggingFace 拉模型和基准数据并缓存下来之后几秒就能出结果。速度列还按颜色标了实用性红色基本别碰、绿色起才适合日常扫一眼就知道哪几个真能用。下面几个场景都是在这条命令上加几个开关。显存吃紧只看全塞进显卡的模型默认排名会把部分掉到内存纯 CPU的候选也塞进来求稳就只留整卡装得下的。需求怕推荐了会掉显存、加载一半 OOM 的模型。命令whichllm --gpu-only --speed usable --vram-headroom 1GB。结果只留整卡装得下的候选速度低于 10 t/s 的直接砍掉还给运行时留 1GB 余量#1 Qwen/Qwen3.6-27B 27.8B Q5_K_M score 92.8 27 t/s #2 Qwen/Qwen3-32B 32.0B Q4_K_M score 83.0 31 t/s #3 Qwen/Qwen3-30B-A3B 30.0B Q5_K_M score 82.7 102 t/s注意第 3 名那个 102 t/s——它是 MoE速度按激活参数算、质量按总参数算这正是 whichllm 和纯看体积工具的分水岭。给长文本调上下文默认按 4096 上下文估 KV cache你要啃长文档就得往上抬。需求想跑 64k 上下文。命令whichllm --context-length 64k。结果表里每个模型的显存需求按 64k 重算原先勉强能塞的 14B 可能掉出推荐显存富余的大卡依旧稳——上下文一改能跑清单就重新洗牌。要啃代码库或长论文直接--context-length 128k。榜单看完直接上手开聊光看榜不落地等于白忙run能把下载、装依赖、起会话一条龙干了。需求立刻和某个模型对话。命令whichllm run qwen 2.5 1.5b gguf或者干脆whichllm run让它自己挑当前硬件的榜首。结果它用uv建一个隔离环境、拉模型、进交互式聊天不碰你本来的 Python 环境GGUF/AWQ/GPTQ/FP16 都能跑只想抄启动代码不真跑用whichllm snippet qwen 7b拿一段 Python 就行。旧显卡值不值得升级纠结换卡别只看显存数字让数据替你算。需求想知道从老卡升到 4090 / 5090 能多跑多少。命令whichllm upgrade RTX 4090 RTX 5090。结果同一台机器CPU、内存不变、只换 GPU分别排出每张目标卡的 best-N 模型质量和 tok/s 的跳变摆在一起值不值得升级一眼看清加--profile coding还能按编程场景比。参数速查选项作用示例值--top/-n显示前 N 个推荐5--context-length/-cKV cache 上下文长度64k--quant/-q只保留某量化Q4_K_M--profile任务画像 general/coding/vision/math/anycoding--gpu模拟指定显卡可多张RTX 4090--gpu-only只要整卡装得下的无值--speed速度下限 any/usable/fastusable--evidence基准证据门槛 strict/base/anystrict--details改显示下载量等元数据无值--vram覆盖显存大小GB16--vram-headroom运行时预留显存1GB--markdown/-m输出可粘贴的 Markdown 表无值--json输出机器可读 JSON无值--refresh忽略缓存重新拉取无值--cpu-only忽略 GPU按纯 CPU 排无值子命令也常用whichllm hardware只查硬件不排名whichllm plan llama 3 70b反查某模型得配哪张卡。完整选项和输出字段在 docs/cli.md。踩坑提醒分数全是~或?基准证据弱加--evidence strict只留独立实测过的模型。显存/带宽检测不准核显、统一内存手动覆盖whichllm --vram 16 --bandwidth 68多卡再加--gpu-index 0。速度列飘红嫌慢就--speed usable10 t/s 起过滤掉估算原理见 docs/hardware.md。收尾whichllm 把能不能跑和跑得快不快揉进同一个分数省掉你逐个试装的折腾。现在就在终端敲一句whichllm看看你的卡真正该跑哪款本地 LLM。【免费下载链接】whichllmFind the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly.项目地址: https://gitcode.com/GitHub_Trending/wh/whichllm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
基恩士PLC上传下载全链路配置:从驱动安装到Host Link通信实战 简介:本资源是一份面向自动化工程师、PLC初学者及现场调试人员的基恩士软件实操指南,聚焦软件安装与程序上传下载两大核心操作,解决工业现场常见的通信配置、程序备份与更新等实际问题。资源为单个2.2MB的Word文档(.docxÿ… · 2026/9/23 22:53:42
机器学习量化投资入门:LightGBM股价预测与回测实战源码解析 简介:这份Python源码面向具备一定编程基础的量化投资学习者与金融数据分析从业者,围绕机器学习在金融市场预测中的应用展开,帮助读者理解如何从K线价格信息中挖掘规律并构建自动化交易决策流程。资源包共15个文件,以5个py脚本为核… · 2026/9/23 22:53:42
基于Spring Boot的学籍管理系统设计与实现 简介:本资源是一份面向高校计算机专业学生与数据库初学者的《学生学籍管理系统》课程设计文档,聚焦教育信息化场景下的数据库应用开发全流程。文档完整覆盖需求分析、概念/逻辑/物理结构设计、E-R图建模、SQL Server 2005关系模式定义(含9张核… · 2026/9/23 22:52:54
PMP必考财务指标:ROI、PBP、NPV、IRR、BCR详解与实战应用 1. 五个指标到底在解决什么问题做项目管理的人,尤其是准备PMP考试或者刚带项目不久的人,大概率都遇到过这样的场景:老板或者PMO把你叫过去,问“这个项目到底值不值得做?投进去的钱多久能回来?收益率比隔壁那… · 2026/9/23 23:23:40
流动稳定性代码包复算指南:从Orr-Sommerfeld方程到中性曲线对拍 简介:压缩包内只有一个MATLAB脚本kuifou_v63.m,专为流动稳定性教学与科研演示而设计,适合流体力学初学者以及希望快速上手数值分析的研究人员。脚本完整覆盖从定义流动域和边界条件、初始化小扰动、谱空间离散,到均值便宜跟踪、Re… · 2026/9/23 23:23:40
遗传算法优化BP神经网络股票预测MATLAB源码实战 简介:这份MATLAB源码资源面向具备一定机器学习基础、希望用遗传算法改进神经网络做股票价格预测的学习者与研究者。包内围绕BP神经网络与遗传算法的结合展开,涵盖基础网络构建、遗传算法编码解码、适应度评估、模型对比以及PCA数据降维等环节,… · 2026/9/23 23:23:33
CXF安装与使用实战:企业级SOAP服务集成指南 1. 这不是“又一个框架教程”,而是你真正用得上的 CXF 实战手记 WebService 这个词,听起来像十年前的老古董——SOAP、WSDL、XML Schema、Axis2……一串串术语让人本能地想划走。但现实是:银行核心系统还在用 SOAP 做跨行清算,政… · 2026/9/23 23:23:33
3招搞定手机怎么下载微信面试难题实战项目解析 3招搞定手机怎么下载微信面试难题实战项目解析 面试被问“手机怎么下载微信”背后的原理,90%的人答不上来。别笑,这看似弱智的问题,实则是考察你对移动应用分发机制、安全校验及网络协议理解的试金石。我带过不少校招新人,他们背了八股文,却连一个A… · 2026/9/23 0:00:03
你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型 你有新短消息请注意查收:3个新手避坑指南搞定消息系统选型 面试被问“高并发下如何保证消息不丢失”,你张口就是“用Redis”,结果面试官追问“如果Redis宕机了怎么办”,你瞬间卡壳。这种场景太常见了,很多新手在背八股文时,只记住了技术名词… · 2026/9/23 0:00:29