llmfit 硬件适配指南:一条命令查出你的机器能跑哪些本地大模型
【免费下载链接】llmfitHundreds of models & providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit
llmfit 是本地大语言模型的硬件适配工具。它读取你的内存、CPU 和 GPU/显存,一条命令告诉你内置目录里几百个模型哪些能在你的机器上跑、大概多快。
llmfit 硬件适配解决什么问题
选本地大模型向来靠感觉:7B 能跑,14B 多半不行;但下载完才发现显存不够,加载不了,或者能跑但慢到没法用。llmfit 的硬件适配把这件事变成一张表:它检测 CPU、内存、GPU/显存,对目录里的模型逐个按内存、速度、质量、上下文四个维度打分排序,每行给出适配等级(Perfect / Good / Marginal / Too Tight)和预估 tok/s(每秒生成 token 数)。
💡 适配等级只由内存占用率决定:≤60% 是 Perfect,≤85% 是 Good,≤98% 是 Marginal,超过 98% 是 Too Tight。纯 CPU 和 CPU+GPU 混合模式最高只给到 Good。
最快上手路径
不想装也可以:uvx llmfit直接运行。长期使用则按平台安装:
# macOS / Linux(Homebrew) brew install AlexsJones/llmfit/llmfit # Windows(Scoop) scoop install llmfit启动后就是完整的适配结果:
llmfitTUI 顶部显示检测到的硬件(核数、内存、GPU 型号、显存、加速后端),下方表格按综合分排序,每行包含评分、预估 tok/s、推荐量化、运行方式和内存占用。
常用按键:
| 按键 | 作用 |
|---|---|
/ | 按名称搜索,支持部分匹配 |
j/k或 ↑ / ↓ | 上下移动 |
f | 循环切换适配过滤:All / Runnable / Perfect / Good / Marginal |
a | 循环切换可用性过滤:全部 / GGUF 可下 / 已安装 |
s | 切换排序列:评分、参数量、内存、上下文等 |
Enter | 展开选中模型的详情视图 |
h | 查看全部按键 |
q | 退出 |
默认配置,知道什么时候改即可:
| 项目 | 默认值 | 什么时候要改 |
|---|---|---|
| 模型下载目录 | ~/.cache/llmfit/models | 磁盘紧张时,按D在下载管理器里改 |
| Web 仪表盘端口 | 8787 | 端口冲突时换端口或直接关闭 |
| 基准测试结果存储 | ~/.config/llmfit | 不用改 |
⚠️ llmfit 默认在 8787 端口启动一个 Web 仪表盘。不需要就加
--no-dashboard;端口被占则用环境变量LLMFIT_DASHBOARD_PORT换端口。
典型硬件适配场景
装新模型之前,先查能不能跑
想试某个 14B 模型,又怕下载完跑不动。TUI 里按/输入名字,j/k移到它那一行:等级是 Perfect 或 Good 就能跑,Quant 列是推荐量化(如 Q4_K_M),tok/s 列是预估速度;显示 Too Tight 就是内存不够。想细看就按Enter展开详情。
升级硬件之前,先模拟新机器
在纠结要不要换显卡,不用先下单。按S打开硬件模拟,把显存从 16 GB 改成 24 GB,回车应用:所有模型的等级和速度立刻按新规格重算,界面出现 SIM 标记,你能直接看到哪些 30B 模型从 Too Tight 变成 Perfect。看完按Ctrl-R恢复真实硬件。
不信预估,看看同款硬件的人实测了多少
表里的 tok/s 是估算值。按b打开社区排行榜,llmfit 按你的 GPU 型号、显存档位和操作系统自动匹配实测数据,能看到真实的 tok/s、TTFT(首个 token 延迟)和峰值显存,按H还能切换浏览任意 GPU。数字冲突时它按"你的实测 > 社区同款实测 > 外部数据库中位数 > 公式估算"的顺序取信。
进阶玩法
- 要实测,不要估算:让推理服务(llama-server、Ollama 等)跑着,选中模型按
b,llmfit 对运行中的服务做三次真实推理,测出 tok/s 和 TTFT,结果先存到本地~/.config/llmfit,之后随时可用llmfit bench --share提交给社区。完整流程见 docs/benchmarking.md。
- 把问题反过来问:这个模型需要什么硬件:选中模型按
p进入 Plan 模式,改上下文、量化和目标速度,它会给出最小与推荐的显存/内存/核数。算法细节见 docs/how-it-works.md。
常见问题与坑
- 检测不到 GPU:检测依赖 nvidia-smi、rocm-smi 等工具,驱动没装就看不到卡。跑
llmfit doctor查看检测报告。 - 估算值和实测差很多:已识别 GPU 按显存带宽公式算(带宽 ÷ 模型大小 × 0.55 效率因子),未识别的退回后端固定常数。用自己的实测值校准,或按
A打开高级配置调因子。 - 8787 端口被占:llmfit 默认自动起 Web 仪表盘。加
--no-dashboard关闭,或用LLMFIT_DASHBOARD_PORT换端口。 - MoE 模型显存需求看着偏低:混合专家模型每个 token 只激活部分专家,llmfit 按激活参数估算。Mixtral 8x7B 总参数 46.7B,实测约 6.6 GB 显存即可,不是显示错了。
- 分享时提示 "no GitHub credentials":没配 token。
export GITHUB_TOKEN="ghp_your_token"后重启 llmfit。
延伸阅读
- TUI 按键、过滤器、模拟与排行榜完整手册:docs/tui.md
- 从启动服务到实测分享基准的完整流程:docs/benchmarking.md
- 四维评分、速度估算公式与适配等级算法:docs/how-it-works.md
- Ollama / llama.cpp / vLLM / MLX 的检测与端点配置:docs/providers.md
- 社区基准数据的 JSON 格式定义:llmfit-core/data/community/schema.json
【免费下载链接】llmfitHundreds of models & providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考