
AI PC时代本地大模型跑得慢很多人第一反应是显卡不行、显存不够然后琢磨着是不是该上RTX 5090或者等下一代显卡。但实际上我最近在帮人调试本地部署的时候发现一个特别容易被忽略的瓶颈——SSD。没错就是那块硬盘。当你把大模型从显卡、内存一路排查完之后最后卡住你的很可能是SSD的读写速度。这事要从一次实测说起。我给朋友一台配置相当不错的AI PC装本地大模型CPU是i7级别显卡是RTX 4070内存也加到了32GB。按理说跑个7B、13B的模型应该挺流畅结果加载模型的时候进度条走得那叫一个磨叽启动一次要等半天。刚开始我还以为是模型量化版本的问题换了好几个GGUF格式的文件速度一点没变。后来我打开任务管理器看了一眼CPU占用率不高GPU占用率也不高但磁盘读写那一项直接飙到了100%。那一刻我才反应过来问题根本不在算力上而是SSD拖了后腿。大模型本地化部署看着是GPU干活实际上从磁盘加载模型参数、把模型从显存换到内存、甚至做KV Cache的交换分分钟都在考验存储设备的性能。这篇文章我就想聊聊AI PC时代搞大模型本地化SSD到底扮演了什么角色为什么它会影响你的实际体验以及如果你正打算新装一台AI PC或者升级旧机器应该怎么选SSD、怎么配置才能让大模型跑得更顺畅。这里面有不少是我自己踩坑踩出来的经验也有一些是反复对比测试得出的结论希望能对你有实际帮助。1. 大模型部署看起来吃显卡为什么SSD会被卡成瓶颈先搞清楚一件事运行大模型的时候数据到底是怎么流动的。每当你启动一个本地大模型程序要做的第一件事是把存储在大模型文件里的全部参数从SSD加载到内存或者显存里。一个大模型的参数量动辄几十亿甚至上百亿即便用4bit量化10B级别的模型也要占用5-7GB的存储空间如果是70B级别的模型那直接就是40GB起步了。你想想这些数据全部要通过SSD读一遍才能交到GPU手里开始推理整个过程里SSD就是唯一的数据入口。加载过程只是最直观的一部分。真正容易被忽略的是推理过程中的数据交换。比如你开了很大的上下文窗口让模型同时处理很多内容这会带来巨量的KV Cache。KV Cache是用来缓存模型注意力计算中的中间结果的数据结构随着对话轮数增加会越占越多。显存不够用的时候系统就会把一部分KV Cache放到内存里甚至放到磁盘上做临时交换。这个交换动作一旦发生每一次读写都要经过SSDSSD的速度就决定了你的模型在最坏情况下的响应速度。还有一种情况是模型太大没法一次性全塞进显存。这种情况下很多本地推理框架比如llama.cpp、Ollama会采用Memory Mapping的方式把模型文件直接映射到内存里用到哪一层参数就实时从磁盘加载哪一层。这时候磁盘随机的IO性能就不只是影响启动加载了它会直接影响每一轮推理过程中的参数读取速度。我用一个简单的类比来解释本地大模型跑推理就像一个大厨做一桌菜。GPU就是大厨的手速内存是操作台而SSD是身后那个食材仓库。如果仓库取货要等半天你手速再快菜也上不快。所以你会发现一个现象本地大模型实际跑起来的时候GPU利用率经常不是满载的反而时不时掉下去整机看起来没使上劲。这种时候如果CPU和内存都不算差绝大多数情况就是SSD的读取速度跟不上模型参数吐出的速度GPU在空转等数据。很多人花了上万块配显卡最后体验被一块几百块的SSD给毁了。2. PCIe 3.0、4.0还是5.0不同SSD对大模型加载速度的真实影响2.1 先看懂SSD跑分和实际加载大模型的差距很多人选SSD只看顺序读取速度比如标称7000MB/s、10000MB/s这种数字。但说实话对大模型部署来说顺序读取速度并没有想象中那么致命。因为大模型加载的瓶颈除了持续读取大文件之外更多时候是边读边解的过程。你要先把模型文件读出来然后做反量化、格式转换、加载到显存这里面CPU也要参与。我实测过好几块不同规格的SSD在同一个模型、同一个推理框架下的加载时间差异很有参考价值。我用的测试平台配置是CPU为Intel 13代i5内存为DDR5 32GB显卡为RTX 4060 Ti 16GB系统盘为PCIe 4.0 SSD测试模型是Qwen2.5-14B-Instruct的Q4_K_M量化版文件大小约9GB。我分别把模型放在不同性能的SSD上加载结果如下SSD类型标称顺序读取模型加载耗时启动到可对话耗时SATA SSD550MB/s左右约32秒约45秒PCIe 3.0 NVMe3500MB/s左右约18秒约28秒PCIe 4.0 NVMe7000MB/s左右约11秒约18秒注意这还只是14B级别的模型。如果你跑的是70B级别的大模型文件大小动辄40GB以上SATA SSD和PCIe 4.0 SSD之间的加载时间差距会拉到分钟级别。有一次我在SATA SSD上加载一个70B模型光等加载就花了快三分钟那种体验真的让人崩溃。还有一个容易被忽视的细节模型加载完之后第一次对话往往也偏慢。因为推理框架会按需从磁盘读取参数到内存冷启动阶段SSD性能差异会直接影响首token延迟。跑分再高如果实际加载和冷启动阶段跟不上你在应用层感受到的就是慢。2.2 如果你用的是老机器PCIe 3.0 SSD还够用吗现在市面上还有不少老平台只有PCIe 3.0接口比如Intel 10代、11代平台或者AMD的3000系、4000系平台。很多人的想法是反正PCIe 3.0和4.0用起来差不多不值得为此换整机。说实话如果你只是打游戏这话有一定道理毕竟游戏加载主要看顺序读取PCIe 3.0和4.0的实际差距也就一两秒。但放在大模型本地化场景我建议你还是尽可能升到PCIe 4.0。原因有两方面。第一大模型文件体量远超普通游戏几十GB的吞吐量会把顺序读取能力的差距放大得非常明显。第二现在入门级的PCIe 4.0 SSD价格已经压得非常低和PCIe 3.0 SSD的价差基本可以忽略。如果是为了跑本地大模型我甚至建议直接上旗舰级PCIe 4.0 SSD把顺序读取和随机读取都拉满。2.3 PCIe 5.0 SSD到底值不值得为AI PC投资PCIe 5.0 SSD的标称速度已经干到10000MB/s甚至14000MB/s看起来非常猛。我也专门测过一块PCIe 5.0的盘加载14B模型确实比PCIe 4.0快了几秒但说实话这个提升有点边际效应递减了。因为前面说了模型加载不只是读文件还要经过CPU解压、反量化、往显存里拷贝这一连串操作。PCIe 5.0 SSD把读取时间压缩得很短之后剩下的时间主要耗在CPU和内存搬运上你再怎么提升SSD速度收益也就那样了。那PCIe 5.0 SSD在什么场景下才有意义我个人认为是超大模型70B以上的频繁加载场景或者是多模型切换的场景。比如我需要频繁在Code模型、通用模型、文生图模型之间切换每次都加载几十GB文件PCIe 5.0能明显减少等待时间。如果你只跑一两个模型而且不经常切换PCIe 4.0旗舰盘是性价比最高的选择。2.4 容量选择有个三条线原则除了速度容量也是大模型本地化部署的一个硬指标这块我建议你按三条线来卡。入门线是1TB。如果你只跑7B、14B左右的量化模型再装点常用软件和游戏1TB勉强够用但余量不多。推荐线是2TB。这是我认为AI PC最稳妥的容量起点。一个70B模型就要占40-50GB再加上Embedding模型、Reranker模型、向量数据库、训练数据集1TB很快就见底。2TB能让你比较从容地折腾。进阶线是4TB及以上。适合那种要本地微调模型、同时保留多个底座模型、还要跑RAG知识库的人。我自己主力机现在就是系统盘1TB模型盘2TB数据盘2TB分开管理这样互不干扰模型盘挂了也不影响系统。3. 不只是加载SSD在本地大模型推理全流程中的隐形角色3.1 上下文窗口越拉越长存储压力越大这两年模型越来越大上下文窗口也越来越大。从早期的4K、8K到现在的32K、128K甚至1M本地跑大模型的时候长上下文需求越来越普遍。这也带来了一个存储层面的新压力。长上下文的直接后果是KV Cache占用暴涨。哪怕模型本身不大只要上下文拉长KV Cache的内存占用可能是模型参数的好几倍。我给你一个粗略的参考一个7B模型4bit量化下参数约占4GB但如果跑128K上下文KV Cache在某些配置下可能占用高达15-20GB。显存撑不住就得往内存里放内存再撑不住就得往SSD上写。一旦走到把KV Cache换到SSD这一步SSD的随机写入性能和寿命就会受到考验。这种情况在那些只有16GB显存却硬要跑70B模型的人身上特别常见。我自己就试过在16GB显存的机器上跑Qwen2.5-72B的Q2量化版显存装不下全部层推理框架只能频繁地从SSD读取参数层、写回中间结果。结果就是每生成一个token都要等好几秒SSD灯基本是常亮的。虽然能跑起来但体验基本不可用。这里的问题是如果SSD的4K随机写入性能不行整个延迟会更夸张。所以如果你打算在显存不足的机器上强行跑大模型选SSD时不要只看顺序读取还要关注随机读写性能尤其是4K随机写入。这个参数直接决定了缓存交换的流畅程度。3.2 词表、LoRA合并和Embedding模型全是存储开销除了主模型本地大模型应用还经常需要挂一堆周边的组件。Embedding模型就是把文本转换成向量的模型RAG应用几乎都要用。比如热词里提到的qwen3-embedding-0.6b这种小模型虽然参数量不大但在处理大量文档的时候需要把每篇文章、每个段落都变成向量然后存下来。向量数据存哪里要么是文件系统要么是向量数据库这些IO操作全都在SSD上发生。LoRA微调更是典型。你可能下载了一个基础模型然后用某个LoRA适配层来增强代码能力或者对话风格。推理的时候很多框架会把LoRA权重临时合并到基础模型里这个合并过程既吃内存也要从SSD读取LoRA文件。如果你同时维护了好多套LoRA频繁切换时SSD的读取压力同样不小。还有词表文件和分词器模型虽然单个体积不大但它们在任何一次对话启动时都要被读取。如果SSD的小文件读取延迟高这部分时间也会被放大。很多人总觉得本地大模型加载慢其实慢在文件的频繁小规模读取上。3.3 大模型下载、转换和校验存储的又一个隐形消耗很多人只关注模型推理时的性能忽略了模型的下载、转换和校验过程。一个70B模型的原始权重文件从HuggingFace下载下来可能要100多GB。在下载过程中SSD需要持续写入大量数据。如果模型文件是分片下载的还会涉及临时文件的反复写入。下完之后你可能还要把safetensors格式转成GGUF格式这样llama.cpp和Ollama才能跑这个转换过程会临时生成大文件峰值占用可能是模型体量的两到三倍需要预留足够的存储空间。更麻烦的是损坏文件的校验。本地大模型文件动辄几十GB下载过程中万一网络不稳、断点续传出问题文件损坏了轻则加载报错重则直接无法启动。所以你最好在下载完模型后去对比一下官方提供的SHA256校验值确保文件完整。这个过程同样要全盘读取一遍模型文件SSD读取速度直接影响校验时间。我给个建议下载模型前先确认可用存储空间至少有模型体积的三倍留足转换临时文件和多个量化版本的存放空间。下载工具尽量用支持断点续传和分片下载的避免文件损坏。3.4 虚拟内存别让机械硬盘背锅但也要正确设置Windows在物理内存不够用的时候会使用页面文件pagefile.sys充当虚拟内存。这其实也是大模型本地化部署的一个隐藏坑。很多人跑大模型的时候Windows把所有SSD和HDD按C盘优先的顺序使用页面文件。如果C盘是机械硬盘而显存溢出后系统把数据往页面文件里写那性能会直接跌到地板。反过来如果C盘是SSD但页面文件分配的空间不足也可能触发系统错误。我自己的设置习惯是把虚拟内存设到非系统盘的独立SSD上固定大小比如64GB。这样既不会频繁触发系统自动扩容也不会和系统文件抢信道。固定大小也能减少页文件的碎片化减小随机I/O延迟。你可以在系统属性-高级-性能设置-高级-虚拟内存-更改里操作。对大模型玩家来说这一步千万别省。4. 装机与改造实战SSD选购、分区规划与模型盘迁移避坑指南4.1 装一台AI PCSSD应该怎么搭配如果你准备从零开始配一台专门跑大模型的AI PC我强烈建议你放弃一块硬盘走天下的方案改成系统盘模型盘双盘结构。系统盘建议选一块品质可靠的500GB或1TB PCIe 4.0 NVMe SSD不需要顶配稳定就行主要放操作系统、驱动、常用软件。模型盘是重点建议1TB起步、2TB最好直接挑PCIe 4.0甚至是PCIe 5.0的旗舰型号顺序读取接近或者超过7000MB/s缓存策略要稳定全盘写入不掉速的那种。为什么这么分因为系统盘的数据是持续读写、长期保活模型盘的数据是高频读取、间歇性大文件写入两者的IO特征不一样。放一起的话Windows系统更新、软件后台索引、杀毒扫描这些操作会把模型盘的IO信道挤占掉导致模型加载速度忽快忽慢体验非常不稳定。硬盘接口方面能上NVMe M.2就别选SATA能占用直连CPU的M.2插槽就别跟SATA设备共享带宽。有些主板第二个M.2插槽会和SATA接口共享带宽插了SATA盘会导致M.2降速这个选型时一定要查主板说明书。4.2 系统迁移到SSD怎么保证原系统不翻车很多人不是新装电脑而是旧机器升级给原系统盘换SSD。这时核心问题就是怎么把老系统盘整体迁移到新SSD而且不能破坏原有Windows激活状态。如果你用的正版Windows绑定了微软账户激活是可以跟着账号走的。迁移后如果提示未激活可以进设置-系统-激活-疑难解答选择硬件更改后重新激活登录微软账号就能恢复。如果你用的是品牌机预装的正版系统激活信息通常固化在主板固件里换硬盘不影响。不过我还是想多提醒一句无论你是用系统自带备份还原还是用第三方工具做硬盘克隆迁移前一定要先做一次完整备份。我身边有个人迁移时图省事直接Ghost对拷结果因为分区格式不对、引导文件没处理干净连蓝屏好几次。现在的UEFI引导和GPT分区跟以前MBR时代完全不一样了对拷完经常出现引导损坏。这里推荐一个比较稳的做法先插上新SSD用系统自带的磁盘管理给SSD初始化成GPT再用傲梅分区助手这类工具选择迁移系统到固态硬盘按向导操作就行。它会自动处理好引导分区、恢复分区这些细节迁移完再回BIOS把启动顺序改成新SSD确认启动正常后再格式化旧盘。4.3 把D盘或旧盘的大模型资料搬到新SSD要注意什么还有一种很常见的情况你新加了一块固态硬盘想把原来D盘整盘搬过去比如老的机械硬盘或者SATA SSD上的模型文件、游戏库、素材库。直接剪切粘贴在几百GB数据面前容易出问题中途网络磁盘睡死或者资源管理器卡住很可能造成数据损坏。建议用RobocopyWindows自带来搬。管理员身份打开命令提示符运行robocopy D:\source E:\dest /E /COPYALL /DCOPY:DAT /R:1 /W:1 /MT:16这个命令的意思是把D盘source目录下所有子目录和文件复制到E盘dest目录包括文件属性和时间戳配合多线程技术可以提升传输速度。/R:1的意思是失败重试一次/W:1是重试等待一秒避免在个别坏文件上无限卡住。复制完成后记得用/MIR做一次镜像比对确保两边一致。搬完模型文件后重新启动Ollama或者llama.cpp时要注意重新设置模型路径。Ollama的模型默认路径在C:\Users\用户名\.ollama\models要改到新盘的话设置环境变量OLLAMA_MODELS指向新目录即可。很多人在线下载大模型时把C盘塞爆就是因为没设置这个变量。4.4 NVMe SSD散热别忽视温度过高直接撞墙掉速这个坑我必须要单独拿出来说因为大模型场景真的太容易踩了。加载模型、批量跑Embedding、长上下文吞吐的时候NVMe SSD动不动就开始高负载工作。消费级主板上的M.2插槽尤其是靠近显卡插槽的那一个散热条件往往很差。显卡吹出来的热风直接烘着SSD再加上SSD本身高速读写发热温度轻轻松松就飙到70℃甚至80℃。一旦SSD温度撞到温控墙主控会强制降速来保护颗粒读取速度可能直接从7000MB/s掉到几百MB/s。解决办法也简单给M.2 SSD加装散热片或者选主板上自带大块散热装甲的M.2插槽。如果你用的是PCIe 5.0 SSD最好是买那种自带主动散热风扇的版本或者用主板自带的M.2散热器外加一个小风扇吹着。我自己的模型盘装的就是带热管散热的散热片实测满载的时候温度能比裸盘低十几度速度也稳很多。另外机箱风道也很重要。很多人装了高端显卡和CPU散热器结果M.2 SSD活生生被显卡尾气烤着。有条件的话让显卡下方有个进风扇或者用显卡竖装的方式给M.2留出散热空间。5. 软件侧优化模型路径设置、Ollama缓存与SSD寿命管理5.1 Ollama的模型目录与预加载设置Ollama是目前本地部署大模型最省事的工具之一但它默认把模型放在系统盘这会让C盘空间迅速告急。安装好Ollama之后我建议第一时间检查两个环境变量。OLLAMA_MODELS用来指定模型存放目录把这个变量指向你的模型盘比如E:\ollama\models然后重启Ollama服务。这样你执行ollama pull qwen2.5:14b的时候大文件都会写入模型盘不会动C盘空间。OLLAMA_KEEP_ALIVE控制模型在内存中的驻留时间单位是秒。默认是300秒也就是5分钟内没有新请求模型就会从内存中卸载。如果你经常连续对话、希望反复请求时不用等待重新加载可以把它设长一点比如OLLAMA_KEEP_ALIVE1800让模型在内存里驻留30分钟。这样做的好处是减少频繁从SSD加载模型导致的漫长等待坏处是内存会被模型长期占用。具体设多少根据你的内存容量来调。刚装好Ollama就跑大模型很可能遇到模型在显存里放不下的情况。Ollama可以设置OLLAMA_MAX_LOADED_MODELS也就是最多同时驻留几个模型。设成1就是一次只驻留一个模型。如果设了多个模型同时加载而SSD读取速度跟不上推理时会非常卡顿。我个人建议日常使用设成1切换模型时宁可重新加载一次也别让多个大模型同时抢内存和磁盘IO。5.2 给大模型文件预留缓存目录很多AI应用除了模型本体之外还会在运行时生成很多临时文件比如各种Tokenizers缓存、转换脚本产生的中间文件、Embedding临时向量等。这些临时文件的默认存放位置往往在用户目录下也就是系统盘。如果你跑批量Embedding任务比如处理一个几GB的文档库生成的临时向量数据可能相当可观写满系统盘不是不可能。我建议在部署方案里提前把以下目录也指到模型盘HuggingFace的缓存目录默认在C:\Users\用户名\.cache\huggingface设置环境变量HF_HOME指向新盘。llama.cpp的临时缓存目录。向量数据库的数据目录比如Chroma、Milvus Lite默认存储路径。提前规划好这些能避免很多跑着跑着磁盘满了的意外。我有一次跑RAG应用就是把Embedding模型和向量库全装进默认位置结果一个下午不到C盘120GB的可用空间直接被写成了个位数后来单独给模型和数据分配盘才解决。5.3 SSD寿命没你想得那么脆弱但也要避免写入放大很多人担心大模型频繁读写会快速耗尽SSD寿命。其实这种担心在一定程度上是多余的。现在主流TLC SSD的擦写寿命普遍在600次全盘写入以上QLC在300到500次之间。正常情况下就算你每周下载并转换一个100GB大模型一年下来总写入量也就十来TB离寿命上限还很远。真要说寿命威胁反而是写入放大问题更容易被人忽略。比如系统开了磁盘碎片整理SSD会义务劳动地搬来搬去杀毒软件频繁全盘扫描每一次扫描都在做大量随机读取虽然读取不耗寿命但主控可能额外做垃圾回收导致实际写入量比逻辑写入量高好几倍。所以日常使用时建议做这几件事确认系统对SSD关闭了磁盘碎片整理计划Windows一般会自动识别固态硬盘并关闭但旧系统或迁移后的系统最好手动确认关闭不必要的系统还原点写入如果你空间紧张的话大文件下载、转换、拷贝尽量在模型盘上完成避免系统盘空间长期处于80%以上满的状态。SSD剩余空间太少主控做垃圾回收的效率会变差长期下来性能和寿命都会受影响。提示SSD剩余空间最好保持在20%以上如果你发现模型盘常年处于爆满状态就得考虑换更大容量的盘或者及时删除不再使用的模型文件了。5.4 用软件监控SSD温度和健康度既然SSD可能因为温度过高而掉速那装一个能实时监控SSD温度和健康度的软件就很有必要。CrystalDiskInfo是Windows上非常经典的硬盘检测工具打开后能看到每个硬盘的温度、健康状态、累计通电时间和累计读取/写入量。你在跑大模型高负载读写的时候可以开着CrystalDiskInfo观察SSD温度变化。如果发现温度在正常读写时就超过70℃建议马上加强散热。如果发现健康度里的可用备用空间或磨损均衡计数有明显下降趋势那就该考虑备份数据、准备换盘了。也可以装厂商配套的SSD管理工具像三星的Magician、西数的Dashboard这些工具除了能看到健康状态还能做一些固件升级和性能优化。很多时候SSD在上高强度负载时莫名其妙掉速可能不只是温度问题而是固件bug。及时更新固件有时能解决一些奇怪的兼容性问题。6. 选盘避坑清单与实测大模型场景下的SSD配置模板6.1 别只看标称速度这些参数才是大模型场景的关键看SSD参数时官方标称的连续读取速度看看就好真正需要关注的表格参数主要是这几项。写入缓存策略和缓外速度是最容易被忽略的。很多SSD标称速度很好看但那是SLC缓存内的速度。一旦写入量超出缓存容量速度直接掉到几百MB甚至几十MB每秒。你在频繁下载模型、转换模型格式、批量写入Embedding向量时很容易触发缓外降速。选购前建议去搜一下具体的缓外速度评测选那种全盘写入速度稳定的盘比如采用独立DRAM缓存设计的型号。还有一个是随机读写性能特别是4K随机读取。大模型的加载不全是顺序读取在KV Cache换入换出、小文件频繁读取时4K性能更重要。4K随机IOPS在旗舰盘和入门盘之间差距很大有时候标称顺序读取都差不多实际用起来却一个天上一个地下原因就在这里。能选带独立DRAM缓存DRAM-Less就别碰的盘就别选HMB方案。DRAM缓存对地址映射表的缓存效率影响很大尤其在高负载随机读写场景下有独立DRAM缓存的盘明显更稳。HMB方案虽然也能靠共享主机内存来弥补但在持续高负载时延迟波动更明显。主控和颗粒也很重要。大厂原厂颗粒优先比如三星、海力士、铠侠、长江存储这类原厂颗粒寿命和可靠性更有保障。主控尽量选群联、慧荣、三星、西数等成熟方案这些主控的温度控制、垃圾回收调度都更成熟不容易在长时间高负载运行中出现莫名其妙的掉盘。整机备份策略也得提前说一句SSD随时都可能坏模型文件虽然大多能从网上下回来但你的对话记录、微调过的数据、Embedding向量库如果丢了可能真的找不回来了。建议定时把模型盘里的关键数据备份到机械硬盘或者NAS上。跑大模型的机器数据安全往往比性能更重要。6.2 各预算段的SSD选型配置参考我整理了三个档次的配置思路大家可以根据自己的预算对号入座。配置级别适用场景SSD配置建议代表容量入门配置跑7B-14B量化模型日常体验1TB PCIe 4.0 NVMe SSD入门到中端型号即可系统模型共用1TB进阶级配置跑32B-70B量化模型经常切换多模型系统盘1TB PCIe 4.0 模型盘2TB PCIe 4.0旗舰合计3TB发烧配置70B模型、微调、RAG、本地知识库系统盘1TB 模型盘2TB PCIe 5.0 数据盘4TB HDD/SSD合计7TB入门配置的操作门槛很低很多人手头机器就是1TB单盘直接装了Ollama就跑也能满足基本需求但要注意时常清理模型文件别让磁盘满到影响寿命。进阶级配置是我最推荐的方向系统盘和模型盘分工明确系统更新和杀毒不会干扰模型加载体验明显上一个档次。散热方面系统盘正常用主板散热片模型盘建议上带热管的散热片。发烧配置适合那些要跑微调、RAG知识库和本地代码助手的硬核玩家。系统盘注重稳定模型盘追求速度数据盘不需要多快主要用来冷备份模型文件和训练数据。PCIe 5.0盘虽然贵但在超大模型频繁切换的场景下省下的等待时间确实值得。6.3 新盘通电后必做的三步初始化装上新SSD之后别急着把数据往里灌先花五分钟做好初始化。第一步在Windows磁盘管理里把新盘初始化为GPT分区表格式。别再用MBR了GPT支持大容量分区UEFI引导也更稳定而且以后如果要在同一块盘上装双系统或做系统迁移都方便。第二步确认4K对齐是否已经生效。现在Windows自带分区工具一般会自动对齐但如果你用第三方工具分区或者从旧盘对拷过系统最好用msinfo32或者在命令行里执行winsat disk确认一下。4K未对齐的SSD性能会下降非常明显尤其是随机读写性能可能直接砍半。如果发现分区有偏移问题建议备份数据后重新分区别得过且过。第三步设置好新盘的写入缓存策略。右键点击新盘选择属性-策略默认情况下启用设备上的写入缓存是打开的这个要保留开启。如果你用的是外置SSD或者移动硬盘盒那就要注意不要开启写入缓存否则直接拔线容易丢数据。但内置SSD建议保持开启能在高负载写入时显著提升性能。6.4 大模型文件下载和存储的目录习惯最后聊一个习惯问题大模型的下载和管理一定要建立起规范的目录结构。我自己常用的目录是这样的E:\AI Models ├─ LLM\ # 存放各类对话模型 │ ├─ Qwen2.5-14B-Instruct\ │ └─ Qwen3-Embedding-0.6B\ ├─ Embedding\ # 存放Embedding模型 ├─ Reranker\ # 存放重排模型 ├─ LoRA\ # 存放各类LoRA适配层 └─ Datasets\ # 存放微调数据集和处理脚本每个模型单独一个文件夹内部同时保存模型文件、官方文档、量化说明和校验值文件。这样一来以后找模型、迁移数据、对比多个量化版本都一目了然。我用这套目录管理已经一年多了基本没出过因为文件乱放而找不到模型、或者不知道某个文件是干什么用的窘况。你要尽早也建立一套符合自己习惯的管理规范后面折腾大模型的时候能省心很多。7. 实测参考一个不常见但有效的SSD运维技巧——别让杀毒软件实时扫描模型文件夹写到这里我再分享一个很多人在实际部署中不会想到的坑杀毒软件对模型文件夹的实时监控。大模型文件有很多是二进制大文件杀毒软件的实时防护会在模型加载时同步扫描这些文件导致磁盘IO被大量占用模型启动速度明显下降。Ollama在第一次启动加载一个大模型时Windows Defender可能会在后台全盘扫描这个文件如果文件比较大扫描时间会很长给你的感觉就是卡死了。解决办法很简单把模型存储目录加入Windows Defender的排除名单。操作路径是Windows安全中心-病毒和威胁防护-管理设置-排除项-添加排除项-文件夹把模型盘目录加进去就行。其他第三方杀毒软件也都有类似的排除功能建议设置一下。还有一个相关的小技巧如果模型盘长期不写入新文件也可以考虑关闭Windows搜索索引对整个模型盘的索引服务因为动辄几万个小碎片文件的索引会频繁唤醒SSD制造无意义的IO压力。在服务里找到Windows Search或者直接在磁盘属性里取消勾选除了文件属性外还允许索引此驱动器上文件的内容就能省掉不少后台IO。8. 我这个折腾一年的人最后想说的话大模型本地化部署这件事真的不是把显卡买贵一点就完事了。整套系统里GPU负责高速计算内存负责临时存放数据SSD负责提供持久化的数据和模型文件。三者里的任何一块短板都会直接拖住整个系统的实际表现。我这几个月帮人折腾了挺多台AI PC之后最大的体会就是很多人装完机器跑大模型发现慢第一反应永远是是不是显卡太弱然后换显卡、加显存结果可能那个问题压根不在显卡上。SSD这块你只需要花一两千块钱就能上一个明显缓解存储瓶颈的方案比起动辄大几千上万块的显卡升级性价比高太多了。所以如果你现在准备组装一台AI PC或者刚跑起本地大模型觉得加载慢、推理慢建议你按这个顺序检查先确认模型是不是存在高速NVMe SSD上再确认SSD有没有过热降速然后看看虚拟内存和交换文件是不是被Windows放到了低速硬盘最后再设置一下杀毒软件排除和模型驻留时间。这几步做完绝大多数加载慢、启动慢的问题都能解决。至于SSD的选购我个人的建议非常直接预算允许就上2TB PCIe 4.0旗舰盘当模型盘系统盘用1TB稳定盘分开经常跑70B以上大模型且频繁切换模型的朋友再考虑PCIe 5.0盘SATA盘和机械硬盘就别拿来跑主力的本地大模型了放在NAS里做冷备份就挺好。AI PC时代算力的确重要但算力要真正被发挥出来离不开存储这条数据管道的畅通。别让你的大模型被SSD卡了脖子。