使用 LLaMA-Factory 从 ModelScope 下载模型并微调

LLaMA-Factory   是一个功能强大且易于使用的开源框架,支持对 100 多种大语言模型(LLMs)和视觉语言模型(VLMs)进行统一高效的微调。它集成了   LoRA、QLoRA、DPO、PPO 等多种训练方法,并提供了 Web UI、CLI 和 API 接口,极大简化了模型微调与部署流程。

本文将介绍如何使用 LLaMA-Factory 从 ModelScope(魔搭社区)下载最新推出的 Qwen3-4B-Thinking-2507 模型,并启动 Web 微调界面。该方案特别适合大陆地区的开发者,避免网络问题导致的下载失败或运行异常。

一、安装 LLaMA-Factory

建议用conda或者env创建个独立的python环境,然后克隆官方仓库并安装:

git clone https://github.com/hiyouga/LLaMA-Factorycd LLaMA-Factorypip install -e .

建议使用镜像源加速安装:

pip install -e . -i https://pypi.tuna.tsinghua.edu.cn/simple


上面的方法是安装最新版本,也可以安装一个稍微旧点的稳定版: 建议使用镜像源加速安装: pip install LLaMAFactory -i https://pypi.tuna.tsinghua.edu.cn/simple

二、取消所有代理设置(关键步骤)

由于某些系统或 shell 配置中可能残留代理设置(如 socks://),会导致 httpx 报错:

ValueError: Unknown scheme for proxy URL URL('socks://127.0.0.1:7897/')

为确保 Web UI 正常启动,请执行以下命令彻底清除所有代理环境变量:

# 清除所有常见代理变量unset http_proxyunset https_proxyunset HTTP_PROXYunset HTTPS_PROXYunset ALL_PROXYunset all_proxy
# 检查是否还有残留env | grep -i proxy

如果输出为空,说明代理已完全清除。 否则,请检查 ~/.bashrc~/.zshrc 或 ~/.profile 文件中是否有类似:

export all_proxy="socks://127.0.0.1:7897"

将其删除或改为正确的格式(如 socks5://),然后重新加载配置:

source ~/.bashrc   # 或 source ~/.zshrc

三、启动 Web 微调界面

完成上述设置后,运行以下命令启动图形化微调界面:

llamafactory-cli webui

成功启动后,终端会显示:

* Visit http://ip:port for Web UI, e.g., http://127.0.0.1:7860* Running on local URL: http://0.0.0.0:7860

打开浏览器访问 http://localhost:7860,即可进入 LLaMA Factory 的 Web UI。


四、Web UI 界面简介(附图)

Image

主要功能区域说明:

区域 功能
模型名称 输入模型 ID(如 qwen/Qwen3-4B-Thinking-2507
模型下载源 可选 huggingfacemodelscopeopenmind,推荐国内用户选 modelscope
微调方法 支持 loraqlorafull 等
数据集路径 上传 JSON/CSV 格式训练数据
训练参数 学习率、批次大小、训练轮数等可调节
对话模板 选择对应模型的 prompt 模板

五、示例:微调 Qwen3-4B-Thinking-2507

Qwen3-4B-Thinking-2507 是通义千问系列中支持推理思考(Thinking)能力的 4B 参数模型,适用于需要逻辑推理、代码生成、多步问答等复杂任务。

在 Web UI 中配置如下:

配置项
Model Name or Path qwen/Qwen3-4B-Thinking-2507
Model Source modelscope
Template qwen3_nothink ⚠️(注意!)
Finetuning Method lora (推荐)或 qlora(显存 <16GB 时)
Quantization Bits 若选 QLoRA,设为 4
Dataset 上传你的 SFT 数据集(JSON 格式,含 messages 字段)

🔔 重要提示: Qwen3 的 Thinking 版本(如 -Thinking-2507)在微调时应使用 _nothink 模板,即 qwen3_nothink,以关闭内置推理链,避免与训练数据冲突。 这是官方推荐做法,详见 LLaMA-Factory 文档[1]。

硬件建议:

LoRA 微调:需 ≥12GB 显存(如 RTX 3090 / 4090)•QLoRA (4-bit):≥8GB 显存即可运行

微调完成后,下会再说。


小结

通过以上步骤,可以借助 LLaMA-Factory 从 ModelScope 成功下载并微调 Qwen3-4B-Thinking-2507 模型。

✅ 关键提示:

•务必使用 unset 命令清除所有代理变量。•设置 USE_MODELSCOPE_HUB=1 后,无需代理即可高速下载模型。•Thinking 类模型请使用 qwen3_nothink 模板进行微调。•若仍报错,建议使用 env -i bash 启动干净 shell 测试。


参考资料

•LLaMA-Factory GitHub: https://github.com/hiyouga/LLaMA-Factory[2]•ModelScope - Qwen3-4B-Thinking-2507: https://modelscope.cn/models/qwen/Qwen3-4B-Thinking-2507[3]•官方文档: https://llamafactory.readthedocs.io[4]


📌 如需脚本化训练,可参考 CLI 示例:

CUDA_VISIBLE_DEVICES=0 llamafactory-cli train \  --model_name_or_path qwen/Qwen3-4B-Thinking-2507 \  --template qwen3_nothink \  --finetuning_type lora \  --dataset your_dataset \  --output_dir output/qwen3-4b-lora

References

[1] LLaMA-Factory 文档: https://llamafactory.readthedocs.io [2]https://github.com/hiyouga/LLaMA-Factory [3]https://modelscope.cn/models/qwen/Qwen3-4B-Thinking-2507 [4]https://llamafactory.readthedocs.io

预览时标签不可点

Close

更多

Name cleared

微信扫一扫赞赏作者

Like the AuthorOther Amount

赞赏后展示我的头像

作品

暂无作品

Like the Author

Other Amount

¥

最低赞赏 ¥0

OK

Back

Other Amount

更多

赞赏金额

¥

最低赞赏 ¥0

1

2

3

4

5

6

7

8

9

0

.

大语言模型 · 目录

大语言模型

上一篇搭建本地 AI 应用栈:Ollama + OpenWebUI + LlamaFactory 入门指南下一篇使用 LLaMA-Factory 微调自定义数据并加载对话的完整流程

Close

更多

搜索「」网络结果

Close

调整当前正文文字大小

更多

100%