Appearance
在本地跑大模型这件事,我折腾了将近一个周。下了半天跑不起来、换了两个模型问题依旧、最后才发现是显卡驱动没装对。所以这篇文章:先检测,再动手,不走冤枉路。
一、先用llmfit做硬件检测
llmfit这个工具跑在你的终端里,检测你电脑的CPU、内存、显卡和显存,然后跟模型库里几百个模型做匹配,直接告诉你:哪个模型能跑,哪个模型跑得好,哪个模型跑起来会很吃力。
安装llmfit
Linux和macOS:
bash
curl -fsSL https://llmfit.axjns.dev/install.sh | shHomebrew:
bash
brew install llmfit检测硬件配置
在终端里直接运行:
bash
llmfit默认会进入交互式界面,显示CPU型号和核心数、内存大小、显卡型号和显存。模型列表按"适合度"排序。
RTX 4090(24GB显存,120GB内存)的推荐结果:
- 27B-35B参数模型:跑得很流畅
- 70B参数模型:带不动,别试了
命令行查推荐模型
bash
llmfit --cli recommend --limit 5输出排名前5的推荐模型,包含模型名称、参数量、显存需求、速度估算。
二、环境准备:Ubuntu上的基础配置
显卡驱动
没有显卡驱动,Ollama只能用CPU跑,速度极慢。先检查显卡:
bash
lspci | grep -i nvidia安装CUDA Toolkit驱动(Ubuntu 22.04):
bash
wget https://developer.download.nvidia.com/compute/cuda/repos/ubuntu2204/x86_64/cuda-keyring_1.0-1_all.deb
sudo dpkg -i cuda-keyring_1.0-1_all.deb
sudo apt update
sudo apt install cuda -y验证:
bash
nvidia-smi能看到显卡型号和显存信息,说明驱动装好了。
三、Ollama安装:拉起第一个本地大模型
安装Ollama
bash
sudo apt update && sudo apt upgrade -y
sudo apt-get install zstd
curl -fsSL https://ollama.com/install.sh | sh拉取第一个模型
推荐从中文能力强的模型开始,Qwen3.5(通义千问3.5)35B参数版本对显卡要求不高,中文效果好:
bash
ollama pull Qwen3.5:35B开始对话
bash
ollama run Qwen3.5:35B进入对话界面,直接输入问题,按回车即可。第一次运行会比较慢,后续使用会快很多。
进阶:Ollama API接口
Ollama启动后默认监听本地11434端口,可以通过API调用模型:
bash
curl http://localhost:11434/api/generate -d '{
"model": "Qwen3.5:35B",
"prompt": "本地大模型和在线大模型相比,有什么优势和劣势?"
}'API支持流式输出,和GPT的效果一样,逐字返回。
四、浏览器快速检测:CanIRun.ai
除了llmfit之外,还有一个浏览器端的轻量级工具:https://canirun.ai
不需要安装任何软件,打开网页之后自动检测你电脑的硬件配置,给你一个直观的"能跑哪些模型"的评估结果。
评分等级分五档:
- Runs great(流畅)
- Runs well(良好)
- Decent(还行)
- Tight fit(勉强)
- Barely runs(基本跑不动)
llmfit和CanIRun.ai的区别:
- llmfit是本地检测,数据更准确,考虑了实际运行环境
- CanIRun.ai是浏览器端轻量检测,适合快速摸底
两个工具配合着用: 先用CanIRun.ai快速摸底,再在装好环境之后用llmfit做精确推荐。
五、真实使用感受
llmfit解决的最核心问题,不是"哪个模型能跑",而是"我应该选哪个量化版本"。
同一个模型,通常有多个量化版本:Q4_0、Q5_1、Q8_0,显存需求不同,效果也有差异。llmfit会直接告诉你应该选哪个量化版本、速度大概什么水平、效果折损多少。
本地跑大模型这几年变得特别简单。5年前想跑一个能用的大模型,得懂CUDA、编译环境、模型量化,整个过程折腾下来得几天。现在有了Ollama和llmfit,从开机到跑起来不到半小时。
但有一件事必须说清楚: RTX 4090跑Qwen3.5:35B这类大参数模型,复杂一点的任务一跑就是十五分钟起步。
建议: 想清楚你的用途再动手。如果只是日常写文字、翻译、总结,在线大模型几分钟能搞定的事,本地模型要跑十几分钟。先从7B参数模型开始试,能满足大部分需求了再考虑升级。
