Qwen3.8-Flash-Next 开源即用!零基础本地部署 125B 大模型全流程指南

Qwen3.8-Flash-Next正式开源发布,这是一个拥有 125B 参数的多模态 MoE 模型,每个 Token 仅激活约 6B 参数,同时被官方定位为 Qwen4 架构的早期预览版。Qwen3.8-Flash-Next 原生支持 262K Token 上下文,通过 YaRN 扩展后最高可达到 100 万 Token,并且在编码、Agent、办公和多模态任务上展现出了非常强的性能。

Qwen3.8-Flash-Next 开源即用!零基础本地部署 125B 大模型全流程指南

更重要的是,这个 125B 级别的模型现在已经可以通过 GGUF 等量化方案部署到本地,消费级显卡和大内存电脑也开始具备运行它的条件。

从目前公开的实测来看,Qwen3.8-Flash-Next 的本地运行能力相当惊人。有人使用单张 RTX 4090 24GB 跑出了约 21 Token/s 的解码速度,也有人通过 CPU Offload 在 RTX 3090 24GB 上运行,并完成长时间的自主 Agent 任务;在 Apple Silicon 平台上,它同样可以借助 MLX 等方案运行。此外,Qwen3.8-Flash-Next 在代码生成、Three.js、游戏开发以及自主编程 Agent 等场景中的表现也非常亮眼。接下来,我们就来进行本地部署,看看这个被称为 Qwen4 早期预览版的模型,到底有多强。

Qwen3.8-Flash-Next 开源即用!零基础本地部署 125B 大模型全流程指南

本地部署:

一、Qwen3.8-Flash-Next 开源模型

Qwen3.8-Flash-Next 开源模型已经发布在国外开源社区,而且不同尺寸的GGUF格式的量化模型已经同步公布,现在我们可以通过下方的链接来进行下载获取最新模型。

1、Huggingface下载:【点击前往

2、国内网盘下载:【点击前往

TDM Fast 高速下载器:【点击前往】 总有人问我用的下载器是什么,它是收费的软件。

Qwen3.8-Flash-Next 开源即用!零基础本地部署 125B 大模型全流程指南

二、下载最新版 Llama.cpp

   llama.cpp是在本地或云端,以最小的设置和最先进的性能,在各种硬件上实现 LLM(和 VLM)推理。

  • 纯 C/C++ 实现,没有任何依赖项
  • 苹果芯片是一流产品——通过 ARM NEON、Accelerate 和 Metal 框架进行了优化。
  • 支持 x86 架构的 AVX、AVX2、AVX512 和 AMX 指令集
  • 对 RISC-V 架构的 RVV、ZVFH、ZFH、ZICBOP 和 ZIHINTPAUSE 支持
  • 支持 1.5 位、2 位、3 位、4 位、5 位、6 位和 8 位整数量化,以加快推理速度并减少内存占用。
  • 用于在 NVIDIA GPU 上运行 LLM 的自定义 CUDA 内核(通过 HIP 支持 AMD GPU,通过 MUSA 支持 Moore Threads GPU)
  • Vulkan 和 SYCL 后端支持
  • CPU+GPU混合推理,可部分加速大于总显存容量的模型。

llama.cpp 最新版下载方式:

1、Github社区: 【点击前往

2、网盘下载 :【点击前往

Qwen3.8-Flash-Next 开源即用!零基础本地部署 125B 大模型全流程指南

下载后将其解压出来,并在根目录下创建新的文件夹 models,然后在第一步下载的模型文件,多个分卷的gguf格式的文件,都放入llama.cpp 根目录下的models 文件夹下,以备接下来使用。

三、一键启动脚本:

1、国内网盘:【点击下载

将一键启动脚本解压后放入llama.cpp的根目录,双击打开启动即可,启动后你会看到下方这个界面

Qwen3.8-Flash-Next 开源即用!零基础本地部署 125B 大模型全流程指南

然后在浏览器上打开本地访问地址:http://127.0.0.1:8080 就可以正常启动并加载模型了

Qwen3.8-Flash-Next 开源即用!零基础本地部署 125B 大模型全流程指南

虽然我的显存明显不够,但是脚本是通过mmap 从硬盘边读边跑模型的,速度还算可以,居然可以跑到 12t/s 左右,这确实有点出乎意料!为了降低硬件的负担,并减少等待时间,我在脚本里关闭了模型的思考模式

Qwen3.8-Flash-Next 开源即用!零基础本地部署 125B 大模型全流程指南

然后我让它给我写一个几乎接近商业级别的“跑酷游戏”,它居然一次性给我搞定,用时将近23分钟,效果相当OK

Qwen3.8-Flash-Next 开源即用!零基础本地部署 125B 大模型全流程指南

不得不说现在的本地大模型的进步实在是太快了,以前只有商业级的闭源模型才能做出的效果,现在你只需一个稍微可以的电脑硬件,就可以跑出几乎相同的效果,确实有点匪夷所思!

Qwen3.8-Flash-Next 开源即用!零基础本地部署 125B 大模型全流程指南

尤其是这个,Qwen3.8 Flash Next 只用一个提示就构建了一个完整的射击游戏。完全自动化化成,几小时后我打开日志。它在截取自己游戏的屏幕截图,查看它们,然后回去修复看起来不对劲的地方。我从未要求它这样做。

光照是我没预料到的部分。这只是一个令人难以置信地美丽而丰富的灯光。

一个提示的成本:
5小时22分钟挂钟时间
7000万令牌从缓存读取
290万新鲜输入
42.9万输出,其中30.1万是推理

Qwen3.8-Flash-Next 开源即用!零基础本地部署 125B 大模型全流程指南

原创文章,作者:极客智库终身会员,如若转载,请注明出处:https://www.jikezhiku.com/1605.html

上一篇 2026年8月28日 上午9:52
下一篇 2026年9月4日 下午3:44

相关推荐