whichllm 完整指南按硬件和基准测试筛选本地 LLM 模型【免费下载链接】whichllmFind the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly.项目地址: https://gitcode.com/GitHub_Trending/wh/whichllm想在本机跑本地 LLM却不知道哪个模型既装得下、又跑得最快whichllm 自动检测 GPU、CPU 和内存按真实基准测试而非参数数量排名一条命令给出推荐还能直接拉起聊天。适合刚接触本地部署的新手。8GB 显卡到底能跑什么本地模型假设你有一张 8GB 显存的 RTX 4060。在 HuggingFace 上你能搜到 7B、14B 甚至 27B 的 GGUF 文件但装得下不等于跑得好有的模型量化后刚好塞进显存却只能跑到 3 tok/s有的 27B 模型因为架构新、基准分高反而比能塞下的大模型更值得跑。手动逐个对比参数量、下载量和评测表很容易选错。whichllm 把这件事压缩成一条命令检测硬件、估算显存占用权重 KV 缓存 激活开销、预估生成速度再按 0–100 的基准分排序输出。三步完成首次上手第一步安装需要 Python 3.11pip install whichllm或者不安装、直接运行最新版uvx whichllmlatest第二步执行默认命令自动检测本机硬件并打印推荐表whichllm第三步把排名第一的模型跑起来需 PATH 中有 uv首次会下载模型whichllm run到这里就完成了从不知道能跑什么到正在与本机最佳模型对话的全过程。按目标使用从确认硬件到规划升级检查硬件与显存确认本机能否跑本地 LLM如果你怀疑检测不准核显、统一内存或双显卡机器尤其如此单独查看硬件报告whichllm hardware核对输出中的 GPU 型号、显存、CPU 和内存是否符合预期。不一致时用参数手动覆盖例如模拟指定显卡whichllm --gpu RTX 4090 --vram 8 --ram-bandwidth 68多显卡机器可用--gpu-index指定用哪张卡参与计算。按硬件筛选最值得跑的 GGUF 模型默认排名会包含部分显存卸载和纯 CPU候选方便看全貌。只关心能完整装进显存、且速度可用的模型时whichllm --gpu-only --speed usable--speed usable要求预估不低于 10 tok/sfast则是 30 tok/s 起步。输出表中速度按实用度着色低于 4 tok/s 红色4–10 黄色10–30 绿色30 以上亮绿色。针对具体需求继续加条件--quant Q4_K_M锁定量化格式--context-length 64k按长上下文重新估算 KV 缓存--profile coding或 vision、math按用途筛选。模拟目标显卡买前验证显存够不够更换硬件前先模拟whichllm --gpu RTX 4090多卡写法可用--gpu 2x RTX 4090。反过来已看中某个模型、想知道需要什么样的显卡whichllm plan llama 3 70b它会给出不同量化等级下的显存需求。想对比几张候选卡与当前机器的差距whichllm upgrade RTX 4090 RTX 5090 H100一条命令运行模型或导出可复制的代码whichllm run也可以指定模型名支持模糊匹配whichllm run qwen 2.5 1.5b gguf它会通过 uv 创建隔离环境、安装推理依赖、下载模型并进入聊天。若只想拿代码贴进自己的项目whichllm snippet qwen 7bGGUF 模型生成基于 llama-cpp-python 的代码非 GGUF 模型则用 transformers。读懂排名结果避开误判分数由基准质量LiveBench、Artificial Analysis、Aider、Arena ELO 等来源合并加参数规模构成再按证据置信度与运行适配度打折低比特量化会被额外扣减。留意分数旁的标记~表示同族推断!sr表示仅有上传者自报数据?表示无基准数据。只信任独立基准精确匹配的结果时加--evidence strict。默认推荐偏进取会包含临界显存占用。想要更保守的推荐whichllm --gpu-only --speed usable --vram-headroom 1GB模型数据来自 HuggingFace 实时接口并带本地缓存结果会随时间变化用--refresh强制重新拉取。更多细节可查 CLI 参考、评分机制、硬件检测与模拟 和 排错指南。下一步先在终端跑一次whichllm记下本机第一推荐的型号与分数再用whichllm --markdown --top 5生成可粘贴的表格存档。如果近期打算升级硬件用whichllm upgrade把预算内的显卡列出来对比一轮比直接下单踏实得多。【免费下载链接】whichllmFind the local LLM that actually runs and performs best on your hardware. Ranked by real, recency-aware benchmarks, not parameter count. One command, run it instantly.项目地址: https://gitcode.com/GitHub_Trending/wh/whichllm创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
AUTOSAR RTM集成实战:CPU负载测量与性能瓶颈定位 /* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views … · 2026/9/24 13:35:17
十大排序算法之插入排序 定义:有一个已经有序的数据序列,要求在这个已经排好的数据序列中插入一个数,但要求插入后此数据序列仍然有序,这个时候就要用到一种新的排序方法—一插入排序法,插入排序的基本操作就是将一个数据插入到已经排好序的有… · 2026/9/24 13:35:17
【企业智能体开发】实现任务规划与可控的工具调用 小林的投屏问题进入第二轮:她已经说明使用线缆,服务台查到了适用指引,却在尝试后仍看不到画面。此时如果 Agent 只会“调用下一个工具”,它可能重复检索同一篇资料,甚至在员工未确认时直接建单。真正的任务规划,是把目标拆成有前置条件、有完成证据、有退出路径的少量步骤… · 2026/9/24 14:02:12
【企业智能体开发】管理会话上下文与任务状态 小林已经把“线缆连接、A301、屏幕无信号”说清楚,也按指引试过了。她离开聊天窗口去检查设备,几分钟后回来输入:“还是不行。”如果 Agent 只记得最后四个字,就可能重新询问房间号;如果把整段聊天原样塞回模型,却没有明确的任务状态,也可能误以为已经创建了工单。
本篇… · 2026/9/24 14:02:05
【企业智能体开发】用结构化输出约束智能体决策 演示服务台时,小林说“A301 投屏没有画面”。模型给出一段看似热心的回答:“先问连接方式,查一下设备说明;若不行,就创建工单。”这段话适合人阅读,却不适合程序直接执行:它同时包含追问、查询和写入三个动作,而且没有说明什么时候获得员工确认。
企业 Agent 需要把“… · 2026/9/24 14:02:05
【企业智能体开发】建立测试集与回归评测流程 服务台试点一周后,团队准备更换模型,并改进投屏指引的切分方式。演示对话看起来更自然了,小林的问题却可能出现新错误:原来会先追问连接方式,现在直接推荐不适用步骤;原来会在建单前确认,现在把“帮我处理”误当成同意。没有固定的测试集,每一次“优化”都可能悄悄破坏… · 2026/9/24 14:02:05
【企业智能体开发】设计可替换的模型调用适配层 小林的投屏求助已经能在演示循环里走完“追问—查指引—回答”。试点时,团队却遇到一个常见变化:同一套服务台,有些请求需要较强的理解能力,有些只需完成简单分类;某个模型接口维护时,还需要切换到备用服务。如果业务代码里到处都是某家模型的请求字段、消息格式和错误码… · 2026/9/24 14:02:05
【企业智能体开发】用 Python 实现最小智能体执行循环 小林在会议室提交“投屏没有画面”之后,服务台先问连接方式;她回答“线缆连接”后,系统才查适用指引并给出建议。这不是一次模型调用就能完成的问答,而是一段根据中间结果改变下一步的任务。若只把全部历史对话反复塞给模型,程序仍然不知道何时该追问、何时能调用工具、何… · 2026/9/24 14:02:05
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程 简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13
1D-CNN时间序列建模实战:从Conv1d原理到工业落地 简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26
柔软的L:汉语语流中被忽视的舌肌张力控制 1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44