☰
llmfit 硬件适配指南:一条命令查出你的机器能跑哪些本地大模型
2026/9/29 5:46:28 网站建设 项目流程

llmfit 硬件适配指南:一条命令查出你的机器能跑哪些本地大模型

【免费下载链接】llmfitHundreds of models & providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit

llmfit 是本地大语言模型的硬件适配工具。它读取你的内存、CPU 和 GPU/显存,一条命令告诉你内置目录里几百个模型哪些能在你的机器上跑、大概多快。

llmfit 硬件适配解决什么问题

选本地大模型向来靠感觉:7B 能跑,14B 多半不行;但下载完才发现显存不够,加载不了,或者能跑但慢到没法用。llmfit 的硬件适配把这件事变成一张表:它检测 CPU、内存、GPU/显存,对目录里的模型逐个按内存、速度、质量、上下文四个维度打分排序,每行给出适配等级(Perfect / Good / Marginal / Too Tight)和预估 tok/s(每秒生成 token 数)。

💡 适配等级只由内存占用率决定:≤60% 是 Perfect,≤85% 是 Good,≤98% 是 Marginal,超过 98% 是 Too Tight。纯 CPU 和 CPU+GPU 混合模式最高只给到 Good。

最快上手路径

不想装也可以:uvx llmfit直接运行。长期使用则按平台安装:

# macOS / Linux(Homebrew) brew install AlexsJones/llmfit/llmfit # Windows(Scoop) scoop install llmfit

启动后就是完整的适配结果:

llmfit

TUI 顶部显示检测到的硬件(核数、内存、GPU 型号、显存、加速后端),下方表格按综合分排序,每行包含评分、预估 tok/s、推荐量化、运行方式和内存占用。

常用按键:

按键作用
/按名称搜索,支持部分匹配
j/k或 ↑ / ↓上下移动
f循环切换适配过滤:All / Runnable / Perfect / Good / Marginal
a循环切换可用性过滤:全部 / GGUF 可下 / 已安装
s切换排序列:评分、参数量、内存、上下文等
Enter展开选中模型的详情视图
h查看全部按键
q退出

默认配置,知道什么时候改即可:

项目默认值什么时候要改
模型下载目录~/.cache/llmfit/models磁盘紧张时,按D在下载管理器里改
Web 仪表盘端口8787端口冲突时换端口或直接关闭
基准测试结果存储~/.config/llmfit不用改

⚠️ llmfit 默认在 8787 端口启动一个 Web 仪表盘。不需要就加--no-dashboard;端口被占则用环境变量LLMFIT_DASHBOARD_PORT换端口。

典型硬件适配场景

装新模型之前,先查能不能跑

想试某个 14B 模型,又怕下载完跑不动。TUI 里按/输入名字,j/k移到它那一行:等级是 Perfect 或 Good 就能跑,Quant 列是推荐量化(如 Q4_K_M),tok/s 列是预估速度;显示 Too Tight 就是内存不够。想细看就按Enter展开详情。

升级硬件之前,先模拟新机器

在纠结要不要换显卡,不用先下单。按S打开硬件模拟,把显存从 16 GB 改成 24 GB,回车应用:所有模型的等级和速度立刻按新规格重算,界面出现 SIM 标记,你能直接看到哪些 30B 模型从 Too Tight 变成 Perfect。看完按Ctrl-R恢复真实硬件。

不信预估,看看同款硬件的人实测了多少

表里的 tok/s 是估算值。按b打开社区排行榜,llmfit 按你的 GPU 型号、显存档位和操作系统自动匹配实测数据,能看到真实的 tok/s、TTFT(首个 token 延迟)和峰值显存,按H还能切换浏览任意 GPU。数字冲突时它按"你的实测 > 社区同款实测 > 外部数据库中位数 > 公式估算"的顺序取信。

进阶玩法

  • 要实测,不要估算:让推理服务(llama-server、Ollama 等)跑着,选中模型按b,llmfit 对运行中的服务做三次真实推理,测出 tok/s 和 TTFT,结果先存到本地~/.config/llmfit,之后随时可用llmfit bench --share提交给社区。完整流程见 docs/benchmarking.md。

  • 把问题反过来问:这个模型需要什么硬件:选中模型按p进入 Plan 模式,改上下文、量化和目标速度,它会给出最小与推荐的显存/内存/核数。算法细节见 docs/how-it-works.md。

常见问题与坑

  • 检测不到 GPU:检测依赖 nvidia-smi、rocm-smi 等工具,驱动没装就看不到卡。跑llmfit doctor查看检测报告。
  • 估算值和实测差很多:已识别 GPU 按显存带宽公式算(带宽 ÷ 模型大小 × 0.55 效率因子),未识别的退回后端固定常数。用自己的实测值校准,或按A打开高级配置调因子。
  • 8787 端口被占:llmfit 默认自动起 Web 仪表盘。加--no-dashboard关闭,或用LLMFIT_DASHBOARD_PORT换端口。
  • MoE 模型显存需求看着偏低:混合专家模型每个 token 只激活部分专家,llmfit 按激活参数估算。Mixtral 8x7B 总参数 46.7B,实测约 6.6 GB 显存即可,不是显示错了。
  • 分享时提示 "no GitHub credentials":没配 token。export GITHUB_TOKEN="ghp_your_token"后重启 llmfit。

延伸阅读

  • TUI 按键、过滤器、模拟与排行榜完整手册:docs/tui.md
  • 从启动服务到实测分享基准的完整流程:docs/benchmarking.md
  • 四维评分、速度估算公式与适配等级算法:docs/how-it-works.md
  • Ollama / llama.cpp / vLLM / MLX 的检测与端点配置:docs/providers.md
  • 社区基准数据的 JSON 格式定义:llmfit-core/data/community/schema.json

【免费下载链接】llmfitHundreds of models & providers. One command to find what runs on your hardware.项目地址: https://gitcode.com/GitHub_Trending/ll/llmfit

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询