我想把一些数据留在自己机器上处理,不想每次都走云端。本地跑开源模型听起来吓人,其实门槛比想象低,关键是先想清楚要跑多大的。

试水我最推荐 Ollama。它一条命令拉模型、一条命令起服务,我笔记本上先跑七八十亿参数的小模型,体验推理手感,不用配环境折腾半天。

找模型和权重我去 Hugging Face 和 ModelScope 魔搭。两家都有国内能直连的镜像,我下模型前先看清楚体积和显存要求,别一上来拉个几百 G 的回来卡死。

想快速试各家能力又不想本地装,我用 Google AI Studio。它网页里就能调 Gemini 系列做实验,验证想法后再决定要不要搬回本地,省得盲目下载。

没有好显卡又想跑大点的模型,我用 Replicate。它云端按次计费,我临时跑个重任务,用完即走,不占本地资源,适合偶尔一用的场景。

选环境我看三件事。第一是显存,模型参数乘每参数字节数粗略估一下,留一倍余量。第二是内存,加载时内存会飙,太小直接崩。第三是磁盘,模型文件普遍大,提前清好位。

我踩过的坑是不看量化就硬跑。同个模型有不同量化版本,量化低的显存省一大截,效果只掉一点。我先用 4 位量化跑通,不够再升。量化版本我重点讲一下。同个模型有 fp16、q4、q8 等好几种,显存小就选低位量化,效果只降一点,能跑起来比跑不起来重要。我第一次不懂,拉了 fp16 直接爆显存。

环境我尽量简单。Ollama 这类开箱即用的先用着,别一上来就编译源码,编译出错能卡你一整天。等我确认真要在本地长驻,再考虑更省资源的部署方式。

内存我吃过亏。模型加载时内存会冲很高,我八 G 内存的机器跑七 B 模型卡得不行,加了根内存条才顺。下载前一定看清楚运行内存要求,不只是显存。

磁盘空间我也提前清。一个模型动辄几 G 到几十 G,我专门划了个盘放模型,不跟系统盘挤。下载到一半空间不足最折磨人。

云端和本地我搭配用。日常小活本地跑,图隐私;偶尔要跑大模型或者批量任务,丢给 Replicate 这类云端,不烧本地电也不占本地盘。

我还会记一笔账:本地电费加设备折旧,和云端按次付费比,哪个更划算。用量小的时候云端反而便宜,量大了本地才值。我先用小模型练手。七八 B 参数先跑通流程,确认环境没问题,再上大的。直接拉大模型报错都看不懂,挫败感强。

报错我学会读日志。Ollama 这类工具报错信息挺直白,顺着看缺什么库、权限哪里不对,比瞎搜快。

镜像源我提前配。下模型慢得离谱时多半是源的问题,换个近的镜像速度天差地别。

我也试过云端 GPU。本地显存不够又偶尔要跑大的,租个按小时计费的实例,用完释放,比买卡灵活。

我给常用模型建快捷命令。拉取、启动、卸载各一条别名,不每次查文档,省得手生出错。

显存占用我监控。跑的时候看一眼占用,快满了就卸掉不用的模型,不硬挤导致崩。我先用 CPU 试跑再上 GPU。确认流程通了再搬去显卡,免得显存折腾半天发现逻辑都错了。

模型格式我认准一种。gguf 还是 safetensors,选定了就统一,不混着下,省得加载器打架。

我记一笔环境清单。系统版本、驱动、依赖列清楚,换机器照着装,不从头踩坑。

闲置模型我及时卸。不常用的从内存清掉,腾地方给要跑的,机器不卡。我先做最小验证。装好先跑一行 hello,确认链路通,再喂真任务,不闷头配半天。

模型我按用途分层。聊天用小模型,推理用大的,不所有活都上最贵那个。

社区帖子我常翻。同配置踩坑的人多,搜一下省我半天调试。你手头是什么机器?独显还是只有核显?告诉我配置,我把能跑的模型档位给你列出来。