Strata教程:让GISer真正实现了token自由
目录前言1. 最终成绩2. 安装该选哪个模型注意点 1模型下载太慢注意点 2Strata 引擎下载太慢注意点 3如何指定模型路径注意点 4安装 nvidia-cublas 和 nvidia-cuda-runtime 很慢注意点 5如何指定上下文大小和端口注意点 6如何指定推理强度3.结语前言这几天一个新的推理框架Strata火了能让消费级显卡英伟达 30、40 系列实现本地运行 Qwen3.8 Flash。看了 GitHub 上的介绍和很多人的测试用 8G 显存和 32G 内存就能跑出不错的成绩大概 50 tok/s。于是趁着假期我也赶紧试了一下这里记录一下。1. 最终成绩我用 32k 上下文和 128k 上下文分别进行了测试总体来说差别不是很大。显卡英伟达 4080 12G 显存 内存64G 模型Qwen3.8 Flash IQ2_XS 量化版本 速度平均 50 tok/s最高 70 tok/s32k 上下文 速度平均 40 tok/s最高 60 tok/s128k 上下文作为对比我此前本地一直使用的 Qwen3.8-27B成绩差很远显卡英伟达 4080 12G 显存 内存64G 模型Qwen3.8-27B-UD-IQ3_S.gguf 量化版本 速度平均 40 tok/s8k 上下文 速度平均 5 tok/s30k 上下文Claude Code、Codex、OpenCode 等工具初始化时都会发给模型 30k 左右的 token因此这些工具如果接 Qwen3.8-27B体验会非常差。现在有了 Strata可以说是质的提升。速度很快128k 上下文能达到四五十 tok/s比之前 30k 上下文下 5 tok/s 的体验好太多。因此推荐大家都去试一试。2. 安装该选哪个模型安装程序会根据你的内存推荐一个。同一个模型有几种规格压缩程度不同。规格越小越快越大越聪明一些。你的内存选择原因32 GBCoder(IQ1_M)32 GB 装得下而且专为代码打造如果显卡是 24 GBQ2_0 和 IQ2_XS 也能跑48 GBIQ2_XS或 Q2_0最快更大的规格装不下64 GBIQ2_XS推荐或 IQ3_XXS / IQ3_S所有规格都装得下IQ3_S 最好也最慢96 GB 或以上IQ3_S或 Unsloth 的 UD-IQ4_XS约 4-bit开着其他程序也能放下最大的规格因为这是一个 Python 项目起初我想用 Conda 创建环境但安装时才发现不能用 Conda 环境因为项目的安装步骤把 Python 环境固定在了项目的.venv文件夹中。项目地址是https://github.com/Niko1221/Strata安装时只需先把项目克隆到本地然后双击SETUP.bat本质上会调用START-HERE.bat程序就会自动一步步往下执行。不过这种方式会比较慢具体原因见下文。注意点 1模型下载太慢这个项目会自动到 Hugging Face 下载 Qwen3.8 Flash。即使是 Q2 量化版本也有 70GB 左右很慢。因此推荐大家自己到 Hugging Face 中国镜像站https://hf-mirror.com/models下载会快很多。注意要选 SC117 开头的只有这里面有mtp-q2_0.gguf后面会用到。注意点 2Strata 引擎下载太慢我在这里卡了很久。Start-Here.bat运行时并不会在 cmd 窗口中显示正在下载什么。有些电脑访问 GitHub Release 并不稳定程序就会不停重试。比如我的电脑就反复卡在这个界面等了十几分钟都没有任何进展一度以为安装失败了。后来我仔细观察任务管理器才发现它其实是在后台默默下载 Strata 引擎的 release 压缩包只是没有任何进度提示看起来就像卡死了一样。而且这个下载过程是串行的如果网络不稳定一次失败就要从头重试非常折磨人。比如我的情况解决办法就是自己去 GitHub Release 页面下载解压后放到engine目录下即可。注意点 3如何指定模型路径运行START-HERE.bat时可以用--gguf-dir指定模型路径。注意一定要把前文下载的几个文件都放到同一个文件夹下。D:\code5\Strata-mainSTART-HERE.bat --yes --family qwen --model IQ2_XS --no-start --gguf-dir D:\ollama\models\Qwen3.8-Flash-Next --data-dir D:\code5\Strata-data参数含义作用与说明START-HERE.batWindows 启动入口脚本内部调用setup.py负责检查硬件、创建.venv、安装依赖、准备模型、生成启动脚本--yes自动确认对所有交互提问自动选择推荐值不再弹出确认适合自动化或不想手动选择--family qwen指定模型家族使用 Qwen3.8-Flash-Next 原版。其他可选swift、coder、unsloth--model IQ2_XS指定量化规格告诉 setup 要运行IQ2_XS。这是固定选项不是文件名若使用IQ3_S替换为对应值即可--no-start安装后不启动只完成安装和配置不自动启动服务。方便先查看生成的run-xxx.bat再手动启动--gguf-dir D:\ollama\models\Qwen3.8-Flash-Next已有 GGUF 模型目录让 setup 从这个目录读取已经下载好的 IQ2_XS 分片文件避免重新下载--data-dir D:\code5\Strata-dataStrata 数据目录存放模型包、MTP 文件、专家缓存、JSON 配置和日志等注意点 4安装 nvidia-cublas 和 nvidia-cuda-runtime 很慢第四步安装 Strata 引擎时我卡在这两个包很久。原本的命令是D:\code5\Strata-main\.venv\Scripts\python.exe -m pip install --quiet --disable-pip-version-check nvidia-cublas13.0.2.14 nvidia-cuda-runtime13.0.96可以按CtrlC停掉然后自己用uv安装很快。命令是在前面加上uv即可cd /d D:\code5\Strata-main .venv\Scripts\activate uv pip install --quiet --disable-pip-version-check nvidia-cublas13.0.2.14 nvidia-cuda-runtime13.0.96注意点 5如何指定上下文大小和端口安装完后会在目录下生成一个run xxx.batxxx就是你选择的量化版本。以后执行它就会直接启动模型。修改上下文大小和端口需要修改strata-xxx.json文件。注意点 6如何指定推理强度浏览器输入http://127.0.0.1:8080点击齿轮进行修改。3.结语AI 发展太快了现在居然能在本地跑 125B 的模型以前根本不敢想。因为我们使用的是 Qwen3.8-Flash-Next Q2 或 Q3 量化版本根据作者测试深度思考模式下的输出质量要比浅层思考模式好很多当然也更费时间。现在 token 的问题解决了于是又回到之前谈过的话题AI 时代拼的是创意。谁的创意好谁就能做出好东西。希望大家都能抓住这一波风口回见~