2026年7月22日

llmfit:先算清本机能跑什么模型,再下载几十 GB 权重

本地部署大模型最常见的浪费,不是安装失败,而是模型下载完才发现显存不够、量化选错,或者速度根本无法接受。llmfit 是一个开源终端工具:它读取电脑的内存、CPU、GPU 与显存,为数百个模型估算可运行性,并按质量、速度、内存适配度和上下文能力排序。项目近日进入 GitHub 日

本地部署大模型最常见的浪费,不是安装失败,而是模型下载完才发现显存不够、量化选错,或者速度根本无法接受。llmfit 是一个开源终端工具:它读取电脑的内存、CPU、GPU 与显存,为数百个模型估算可运行性,并按质量、速度、内存适配度和上下文能力排序。项目近日进入 GitHub 日榜,7 月 21 日发布 v1.1.6,采用 MIT 许可证。

📌 这个项目是干什么的

llmfit 支持交互式 TUI,也提供适合脚本和 Agent 调用的 CLI、JSON 输出与本地 REST API。它能识别 NVIDIA、AMD、Intel Arc、Apple Silicon 和昇腾等硬件路径,并根据任务类型筛选通用、编程、推理、对话、多模态或 Embedding 模型。

它不负责训练模型,也不是一个推理引擎。更准确的定位是“本地模型选型器”:先判断哪个模型、哪种量化和运行方式更适合当前机器,再交给 Ollama、llama.cpp、MLX、vLLM 等后端运行。

🔍 为什么值得关注

第一,它不只看参数量。工具会从 Q8_0 到 Q2_K 尝试可容纳的量化档位,也会区分纯 GPU、CPU+GPU、CPU 以及 MoE 专家卸载,避免用“7B 能不能跑”这种过于粗糙的判断。

第二,推荐结果可以解释。运行 llmfit info "<模型名>",能查看速度估算采用的硬件带宽、模型大小和效率系数,而不是只给一个黑盒分数。v1.x 还加入真实基准流程:对已经启动的模型测量 tokens/s 与首 Token 延迟,本机实测值会优先替代公式估算。

第三,它适合进入自动化流程。llmfit recommend --json 可把推荐结果交给脚本或 Agent;llmfit serve 则能为节点调度器提供模型适配查询 API。

🧪 谁适合试,怎么开始

更适合准备部署本地模型、需要管理多种硬件,或正在为团队制定模型选型规则的开发者。最短路径是不安装直接运行:

uvx llmfit
llmfit recommend --json --use-case coding --limit 3
llmfit info "<模型名>"

macOS 与 Linux 也可用 Homebrew,Windows 可用 Scoop。建议先核对顶部识别出的 RAM、GPU 和显存;识别异常时运行 llmfit doctor,必要时再用 --memory--ram 手动覆盖。

⚠️ 使用提醒

推荐表里的速度主要是估算,不是性能承诺。驱动、推理后端、上下文长度、KV Cache、CPU 卸载和模型实现都会影响结果;陌生模型族还可能回退到启发式评分。真正准备投入生产前,应先启动模型,再用 llmfit bench 做本机实测。

另外,模型目录内置在发布包中,更新模型列表需要升级 llmfit。基准结果默认先保存在本地;只有主动启用 --share 并确认后,才会通过 GitHub 流程提交社区数据。

🔗 参考资源