• 2025-07

    使用ollama快速部署并运行最新的qwen3-30b-a3b-2507模型

    qwen3最新的 qwen3-30b-a3b-2507感觉很棒,在8g显存的4060显卡上都能达到4-5tokens/s。

    Image

    顺手把gguf生成,并且转成了ollama能用的q8量化版本,然后推送到了ollama的hub上面。

    懒得折腾的同学,可以下载安装ollama,然后在终端运行下面的命令:

    ollama run …