Skip to content

LLMFit+Ollama本地AI:硬件检测到模型跑起的完整指南

2026年4月30日

在本地跑大模型这件事,我折腾了将近一个周。下了半天跑不起来、换了两个模型问题依旧、最后才发现是显卡驱动没装对。所以这篇文章:先检测,再动手,不走冤枉路。


一、先用llmfit做硬件检测

llmfit这个工具跑在你的终端里,检测你电脑的CPU、内存、显卡和显存,然后跟模型库里几百个模型做匹配,直接告诉你:哪个模型能跑,哪个模型跑得好,哪个模型跑起来会很吃力。

安装llmfit

Linux和macOS:

bash
curl -fsSL https://llmfit.axjns.dev/install.sh | sh

Homebrew:

bash
brew install llmfit

检测硬件配置

在终端里直接运行:

bash
llmfit

默认会进入交互式界面,显示CPU型号和核心数、内存大小、显卡型号和显存。模型列表按"适合度"排序。

RTX 4090(24GB显存,120GB内存)的推荐结果:

  • 27B-35B参数模型:跑得很流畅
  • 70B参数模型:带不动,别试了

命令行查推荐模型

bash
llmfit --cli recommend --limit 5

输出排名前5的推荐模型,包含模型名称、参数量、显存需求、速度估算。


二、环境准备:Ubuntu上的基础配置

显卡驱动

没有显卡驱动,Ollama只能用CPU跑,速度极慢。先检查显卡:

bash
lspci | grep -i nvidia

安装CUDA Toolkit驱动(Ubuntu 22.04):

bash
wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-keyring_1.0-1_all.deb
sudo dpkg -i cuda-keyring_1.0-1_all.deb
sudo apt update
sudo apt install cuda -y

验证:

bash
nvidia-smi

能看到显卡型号和显存信息,说明驱动装好了。


三、Ollama安装:拉起第一个本地大模型

安装Ollama

bash
sudo apt update && sudo apt upgrade -y
sudo apt-get install zstd
curl -fsSL https://ollama.com/install.sh | sh

拉取第一个模型

推荐从中文能力强的模型开始,Qwen3.5(通义千问3.5)35B参数版本对显卡要求不高,中文效果好:

bash
ollama pull Qwen3.5:35B

开始对话

bash
ollama run Qwen3.5:35B

进入对话界面,直接输入问题,按回车即可。第一次运行会比较慢,后续使用会快很多。

进阶:Ollama API接口

Ollama启动后默认监听本地11434端口,可以通过API调用模型:

bash
curl http://localhost:11434/api/generate -d '{
  "model": "Qwen3.5:35B",
  "prompt": "本地大模型和在线大模型相比,有什么优势和劣势?"
}'

API支持流式输出,和GPT的效果一样,逐字返回。


四、浏览器快速检测:CanIRun.ai

除了llmfit之外,还有一个浏览器端的轻量级工具:https://canirun.ai

不需要安装任何软件,打开网页之后自动检测你电脑的硬件配置,给你一个直观的"能跑哪些模型"的评估结果。

评分等级分五档:

  • Runs great(流畅)
  • Runs well(良好)
  • Decent(还行)
  • Tight fit(勉强)
  • Barely runs(基本跑不动)

llmfit和CanIRun.ai的区别:

  • llmfit是本地检测,数据更准确,考虑了实际运行环境
  • CanIRun.ai是浏览器端轻量检测,适合快速摸底

两个工具配合着用: 先用CanIRun.ai快速摸底,再在装好环境之后用llmfit做精确推荐。


五、真实使用感受

llmfit解决的最核心问题,不是"哪个模型能跑",而是"我应该选哪个量化版本"。

同一个模型,通常有多个量化版本:Q4_0、Q5_1、Q8_0,显存需求不同,效果也有差异。llmfit会直接告诉你应该选哪个量化版本、速度大概什么水平、效果折损多少。

本地跑大模型这几年变得特别简单。5年前想跑一个能用的大模型,得懂CUDA、编译环境、模型量化,整个过程折腾下来得几天。现在有了Ollama和llmfit,从开机到跑起来不到半小时。

但有一件事必须说清楚: RTX 4090跑Qwen3.5:35B这类大参数模型,复杂一点的任务一跑就是十五分钟起步。

建议: 想清楚你的用途再动手。如果只是日常写文字、翻译、总结,在线大模型几分钟能搞定的事,本地模型要跑十几分钟。先从7B参数模型开始试,能满足大部分需求了再考虑升级。

不要孤军奋战啦!

加入微信群一起学习交流 AI

与大神一起使用 OpenClaw、Hermes、Claude Code、Seedance 2.0、GPT-Image-2 等

微信公众号

扫码关注微信公众号
私信 "加群",将自动获取微信群二维码

探索 AI 世界,掌握智能未来