前置条件
- 拥有一个阿里云账号,并完成实名认证。
- 了解基本的大模型概念(如模型训练、推理、部署)。
- 确保账号已开通百炼控制台服务(可在控制台首页免费开通)。
学完能做什么
- 使用预训练模型进行零代码或低代码的推理(如文本生成、对话、翻译)。
- 通过上传数据集,对基础模型进行微调(SFT/RLHF),定制专属行业模型。
- 将训练好的模型部署为在线API,供业务系统调用。
- 监控模型调用量、延迟、错误率,并设置告警。
分步操作
1. 进入百炼控制台
- 打开浏览器,访问
https://bailian.console.aliyun.com/ - 使用阿里云账号登录(若未登录,会跳转到登录页)。
- 首次进入时,系统会提示开通服务,点击「立即开通」并同意协议。
2. 选择模型并快速体验推理
- 在左侧导航栏点击「模型广场」。
- 浏览模型列表(如通义千问、Llama、ChatGLM等),点击任意模型进入详情页。
- 点击「在线体验」,在输入框中输入问题(如“用一句话解释量子计算”),点击发送。
- 系统返回模型回答,确认推理功能正常。
3. 创建数据集并上传训练数据
- 在左侧导航栏点击「数据管理」→「数据集」。
- 点击「创建数据集」,填写名称(如“客服问答数据”),选择类型(如“对话”或“文本”)。
- 点击「上传文件」,支持JSONL、CSV、TXT格式(每条数据需符合模型微调规范,如
{"instruction":"...", "output":"..."})。 - 上传完成后,系统自动校验格式,状态变为“已就绪”。
4. 启动模型微调(SFT)
- 在左侧导航栏点击「模型训练」→「训练任务」。
- 点击「创建训练任务」,选择基础模型(如“通义千问-7B”)。
- 在「训练数据」中选择上一步创建的数据集。
- 配置训练参数:
- 学习率:默认0.0001(新手可保持默认)
- 训练轮数:建议3-5轮(根据数据量调整)
- 输出路径:选择OSS Bucket(如无,需先创建OSS存储桶)
- 点击「开始训练」,任务状态变为“运行中”。训练时间取决于数据量(通常1-10小时)。
5. 部署微调后的模型为API
- 训练完成后,在「模型训练」→「训练任务」中找到该任务,点击「部署」。
- 选择部署规格:
- 实例数:至少1(支持弹性伸缩)
- 推理资源:按需选择(如A10、V100 GPU)
- 点击「确认部署」,等待约5-15分钟,状态变为“运行中”。
- 部署成功后,系统生成API端点(如
https://bailian.aliyuncs.com/v1/chat/completions)和API Key。
6. 调用API进行推理
- 在「模型部署」→「推理服务」中,复制API Key和端点URL。
- 使用curl或编程语言调用(示例curl命令):
curl -X POST https://bailian.aliyuncs.com/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "your-model-name",
"messages": [{"role": "user", "content": "你好"}]
}'
预期结果
- 完成上述步骤后,你将获得一个可在线调用的定制模型API。
- 在「模型部署」→「监控」中,可查看调用量、平均延迟、错误率等指标。
- 在「模型部署」→「告警」中,可设置阈值(如延迟>5秒时触发通知)。
常见问题
| 问题 | 原因 | 解决方案 |
|---|
| 数据集上传失败 | 格式不符合JSONL规范 | 检查每行是否为有效JSON,且包含 instruction 和 output 字段 |
| 训练任务长时间卡在“排队中” | GPU资源不足 | 降低训练轮数或选择更小的基础模型 |
| 部署后API调用返回401 | API Key错误或过期 | 在「模型部署」→「推理服务」中重新生成Key |
| 推理结果质量差 | 微调数据量不足或质量低 | 增加数据量(建议至少1000条),并清洗数据(去除噪声、重复) |
注意事项
- 免费额度:首次开通后,通常有500万Token的免费推理额度,训练资源需按量付费。
- 数据安全:上传的数据集和训练后的模型仅你可见,阿里云不会用于其他用途。
- 模型选择:新手建议从7B或13B参数量的模型开始,训练成本低且效果可控。
- 失败排查:若训练失败,查看任务日志(在训练任务详情页),常见错误包括数据格式错误、OSS路径不可写、资源不足。