LLaMA-Factory 是一个功能强大且易于使用的开源框架,支持对 100 多种大语言模型(LLMs)和视觉语言模型(VLMs)进行统一高效的微调。它集成了 LoRA、QLoRA、DPO、PPO 等多种训练方法,并提供了 Web UI、CLI 和 API 接口,极大简化了模型微调与部署流程。
本文将介绍如何使用 LLaMA-Factory 从 ModelScope(魔搭社区)下载最新推出的 Qwen3-4B-Thinking-2507 模型,并启动 Web 微调界面。该方案特别适合大陆地区的开发者,避免网络问题导致的下载失败或运行异常。
一、安装 LLaMA-Factory
建议用conda或者env创建个独立的python环境,然后克隆官方仓库并安装:
git clone https://github.com/hiyouga/LLaMA-Factorycd LLaMA-Factorypip install -e .
建议使用镜像源加速安装:
pip install -e . -i https://pypi.tuna.tsinghua.edu.cn/simple
上面的方法是安装最新版本,也可以安装一个稍微旧点的稳定版: 建议使用镜像源加速安装: pip install LLaMAFactory -i https://pypi.tuna.tsinghua.edu.cn/simple
二、取消所有代理设置(关键步骤)
由于某些系统或 shell 配置中可能残留代理设置(如 socks://),会导致 httpx 报错:
ValueError: Unknown scheme for proxy URL URL('socks://127.0.0.1:7897/')
为确保 Web UI 正常启动,请执行以下命令彻底清除所有代理环境变量:
# 清除所有常见代理变量unset http_proxyunset https_proxyunset HTTP_PROXYunset HTTPS_PROXYunset ALL_PROXYunset all_proxy
# 检查是否还有残留env | grep -i proxy
如果输出为空,说明代理已完全清除。
否则,请检查 ~/.bashrc、~/.zshrc 或 ~/.profile 文件中是否有类似:
export all_proxy="socks://127.0.0.1:7897"
将其删除或改为正确的格式(如 socks5://),然后重新加载配置:
source ~/.bashrc # 或 source ~/.zshrc
三、启动 Web 微调界面
完成上述设置后,运行以下命令启动图形化微调界面:
llamafactory-cli webui
成功启动后,终端会显示:
* Visit http://ip:port for Web UI, e.g., http://127.0.0.1:7860* Running on local URL: http://0.0.0.0:7860
打开浏览器访问 http://localhost:7860,即可进入 LLaMA Factory 的 Web UI。
四、Web UI 界面简介(附图)

主要功能区域说明:
| 区域 | 功能 |
|---|---|
| 模型名称 | 输入模型 ID(如 qwen/Qwen3-4B-Thinking-2507) |
| 模型下载源 | 可选 huggingface、modelscope、openmind,推荐国内用户选 modelscope |
| 微调方法 | 支持 lora、qlora、full 等 |
| 数据集路径 | 上传 JSON/CSV 格式训练数据 |
| 训练参数 | 学习率、批次大小、训练轮数等可调节 |
| 对话模板 | 选择对应模型的 prompt 模板 |
五、示例:微调 Qwen3-4B-Thinking-2507
Qwen3-4B-Thinking-2507 是通义千问系列中支持推理思考(Thinking)能力的 4B 参数模型,适用于需要逻辑推理、代码生成、多步问答等复杂任务。
在 Web UI 中配置如下:
| 配置项 | 值 |
|---|---|
| Model Name or Path | qwen/Qwen3-4B-Thinking-2507 |
| Model Source | modelscope |
| Template | qwen3_nothink ⚠️(注意!) |
| Finetuning Method | lora (推荐)或 qlora(显存 <16GB 时) |
| Quantization Bits | 若选 QLoRA,设为 4 |
| Dataset | 上传你的 SFT 数据集(JSON 格式,含 messages 字段) |
🔔 重要提示: Qwen3 的 Thinking 版本(如
-Thinking-2507)在微调时应使用_nothink模板,即qwen3_nothink,以关闭内置推理链,避免与训练数据冲突。 这是官方推荐做法,详见 LLaMA-Factory 文档[1]。
硬件建议:
•LoRA 微调:需 ≥12GB 显存(如 RTX 3090 / 4090)•QLoRA (4-bit):≥8GB 显存即可运行
微调完成后,下会再说。
小结
通过以上步骤,可以借助 LLaMA-Factory 从 ModelScope 成功下载并微调 Qwen3-4B-Thinking-2507 模型。
✅ 关键提示:
•务必使用
unset命令清除所有代理变量。•设置USE_MODELSCOPE_HUB=1后,无需代理即可高速下载模型。•Thinking 类模型请使用qwen3_nothink模板进行微调。•若仍报错,建议使用env -i bash启动干净 shell 测试。
参考资料:
•LLaMA-Factory GitHub: https://github.com/hiyouga/LLaMA-Factory[2]•ModelScope - Qwen3-4B-Thinking-2507: https://modelscope.cn/models/qwen/Qwen3-4B-Thinking-2507[3]•官方文档: https://llamafactory.readthedocs.io[4]
📌 如需脚本化训练,可参考 CLI 示例:
CUDA_VISIBLE_DEVICES=0 llamafactory-cli train \ --model_name_or_path qwen/Qwen3-4B-Thinking-2507 \ --template qwen3_nothink \ --finetuning_type lora \ --dataset your_dataset \ --output_dir output/qwen3-4b-lora
References
[1] LLaMA-Factory 文档: https://llamafactory.readthedocs.io
[2]: https://github.com/hiyouga/LLaMA-Factory
[3]: https://modelscope.cn/models/qwen/Qwen3-4B-Thinking-2507
[4]: https://llamafactory.readthedocs.io
预览时标签不可点
Close
更多
Name cleared
微信扫一扫赞赏作者
Like the AuthorOther Amount
赞赏后展示我的头像
作品
暂无作品
Like the Author
Other Amount
¥
最低赞赏 ¥0
OK
Back
Other Amount
更多
赞赏金额
¥
最低赞赏 ¥0
1
2
3
4
5
6
7
8
9
0
.
大语言模型 · 目录
大语言模型
上一篇搭建本地 AI 应用栈:Ollama + OpenWebUI + LlamaFactory 入门指南下一篇使用 LLaMA-Factory 微调自定义数据并加载对话的完整流程
Close
更多
搜索「」网络结果
Close
调整当前正文文字大小
更多
100%