Qwen3-0.6B
- 功能:文本生成
- 部署方式:使用1卡 nvidia A100/asend 910b 部署
模型下载
pipinstallmodelscopemkdirQwen3-0.6B modelscope download--modelQwen/Qwen3-0.6B--local_dirQwen3-0.6B镜像
nvidia镜像
vllm/vllm-openai:latestasend镜像
quay.io/ascend/vllm-ascend:v0.18.0模型部署
vllm serve--modelQwen3-0.6B\--host0.0.0.0\--port8000\--tensor-parallel-size1\--max-model-len32768\--reasoning-parser qwen3\--trust-remote-code\--gpu-memory-utilization0.9参数说明:
| 参数 | 值 | 说明 |
|---|---|---|
--model | Qwen3-0.6B | 模型权重路径(mkdir 生成的文件夹目录) |
--host | 0.0.0.0 | 服务监听地址 |
--port | 8000 | 服务监听端口 |
--tensor-parallel-size | 1 | 张量并行数,1卡部署 |
--max-model-len | 32768 | 最大上下文长度(32K token) |
--reasoning-parser | qwen3 | 推理内容解析器,用于解析 Qwen3 的思维链(thinking)输出 |
--trust-remote-code | — | 允许执行模型仓库中自带的远程代码 |
--gpu-memory-utilization | 0.9 | GPU/NPU 显存利用率上限(90%) |
模型请求
curl命令请求
curlhttp://localhost:8000/v1/chat/completions\-H"Content-Type: application/json"\-d'{ "model": "Qwen3-0.6B", "messages": [ {"role": "user", "content": "你好,请你帮我生成一个关于春天的五言绝句!"} ], "max_tokens": 1024, "temperature": 1.0, "top_p": 0.95, "presence_penalty": 1.5, "extra_body": { "top_k": 20 } }'python请求方式
fromopenaiimportOpenAI client=OpenAI(api_key="EMPTY",base_url="http://localhost:8000/v1",timeout=3600)messages=[{"role":"user","content":"你好,请你帮我生成一个关于春天的五言绝句!"},]chat_response=client.chat.completions.create(model="Qwen3-0.6B",messages=messages,max_tokens=1024,temperature=1.0,top_p=0.95,presence_penalty=1.5,extra_body={"top_k":20,},)print("Chat response:",chat_response)请求参数说明:
| 参数 | 值 | 说明 |
|---|---|---|
model | Qwen3-0.6B | 模型名称(部署路径) |
messages | — | 对话消息列表 |
max_tokens | 1024 | 最大生成 token 数 |
temperature | 1.0 | 采样温度,越高越随机 |
top_p | 0.95 | 核采样概率阈值,从概率累积达95%的token中采样 |
presence_penalty | 1.5 | 存在惩罚,抑制已出现token的重复 |
top_k | 20 | Top-K 采样,仅从概率最高的20个token中采样 |
性能测试
vllm bench serve --base-url http://localhost:8000\--backendvllm\--model"Qwen3-0.6B"\--tokenizer"Qwen3-0.6B"\--dataset-name random\--input-len512\--output-len512\--num-prompts10\--num-warmups3\--max-concurrency1\--save-result\--result-dir /path/to/your_save_dir\--result-filename qwen3-0.6b_text_input512_output512_request1_num10.json参数说明:
| 参数 | 值 | 说明 |
|---|---|---|
--base-url | http://localhost:8000 | 被测服务地址 |
--backend | vllm | 后端类型,vllm 原生接口 |
--model | Qwen3-0.6B | 模型名称(与部署路径一致) |
--tokenizer | Qwen3-0.6B | tokenizer 路径 |
--dataset-name | random | 数据集类型,随机生成输入 |
--input-len | 512 | 每条输入 token 长度 |
--output-len | 512 | 每条输出 token 长度 |
--num-prompts | 10 | 测试请求总数 |
--num-warmups | 3 | 预热请求数(不计入统计) |
--max-concurrency | 1 | 最大并发数 |
--save-result | — | 保存测试结果到文件 |
--result-dir | /path/to/your_save_dir | 结果保存目录 |
--result-filename | qwen3-0.6b_text_...json | 结果文件名 |