news 2026/8/28 6:37:48

【LLM】Qwen3-0.6B服务化部署、请求与性能测试

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【LLM】Qwen3-0.6B服务化部署、请求与性能测试

Qwen3-0.6B

  • 功能:文本生成
  • 部署方式:使用1卡 nvidia A100/asend 910b 部署

模型下载

pipinstallmodelscopemkdirQwen3-0.6B modelscope download--modelQwen/Qwen3-0.6B--local_dirQwen3-0.6B

镜像

nvidia镜像

vllm/vllm-openai:latest

asend镜像

quay.io/ascend/vllm-ascend:v0.18.0

模型部署

vllm serve--modelQwen3-0.6B\--host0.0.0.0\--port8000\--tensor-parallel-size1\--max-model-len32768\--reasoning-parser qwen3\--trust-remote-code\--gpu-memory-utilization0.9

参数说明:

参数说明
--modelQwen3-0.6B模型权重路径(mkdir 生成的文件夹目录)
--host0.0.0.0服务监听地址
--port8000服务监听端口
--tensor-parallel-size1张量并行数,1卡部署
--max-model-len32768最大上下文长度(32K token)
--reasoning-parserqwen3推理内容解析器,用于解析 Qwen3 的思维链(thinking)输出
--trust-remote-code允许执行模型仓库中自带的远程代码
--gpu-memory-utilization0.9GPU/NPU 显存利用率上限(90%)

模型请求

curl命令请求

curlhttp://localhost:8000/v1/chat/completions\-H"Content-Type: application/json"\-d'{ "model": "Qwen3-0.6B", "messages": [ {"role": "user", "content": "你好,请你帮我生成一个关于春天的五言绝句!"} ], "max_tokens": 1024, "temperature": 1.0, "top_p": 0.95, "presence_penalty": 1.5, "extra_body": { "top_k": 20 } }'

python请求方式

fromopenaiimportOpenAI client=OpenAI(api_key="EMPTY",base_url="http://localhost:8000/v1",timeout=3600)messages=[{"role":"user","content":"你好,请你帮我生成一个关于春天的五言绝句!"},]chat_response=client.chat.completions.create(model="Qwen3-0.6B",messages=messages,max_tokens=1024,temperature=1.0,top_p=0.95,presence_penalty=1.5,extra_body={"top_k":20,},)print("Chat response:",chat_response)

请求参数说明:

参数说明
modelQwen3-0.6B模型名称(部署路径)
messages对话消息列表
max_tokens1024最大生成 token 数
temperature1.0采样温度,越高越随机
top_p0.95核采样概率阈值,从概率累积达95%的token中采样
presence_penalty1.5存在惩罚,抑制已出现token的重复
top_k20Top-K 采样,仅从概率最高的20个token中采样

性能测试

vllm bench serve --base-url http://localhost:8000\--backendvllm\--model"Qwen3-0.6B"\--tokenizer"Qwen3-0.6B"\--dataset-name random\--input-len512\--output-len512\--num-prompts10\--num-warmups3\--max-concurrency1\--save-result\--result-dir /path/to/your_save_dir\--result-filename qwen3-0.6b_text_input512_output512_request1_num10.json

参数说明:

参数说明
--base-urlhttp://localhost:8000被测服务地址
--backendvllm后端类型,vllm 原生接口
--modelQwen3-0.6B模型名称(与部署路径一致)
--tokenizerQwen3-0.6Btokenizer 路径
--dataset-namerandom数据集类型,随机生成输入
--input-len512每条输入 token 长度
--output-len512每条输出 token 长度
--num-prompts10测试请求总数
--num-warmups3预热请求数(不计入统计)
--max-concurrency1最大并发数
--save-result保存测试结果到文件
--result-dir/path/to/your_save_dir结果保存目录
--result-filenameqwen3-0.6b_text_...json结果文件名
版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/28 6:35:33

Pydantic 数据验证讲解

文章目录一、为什么需要 Pydantic?二、安装三、基础模型(BaseModel)四、Field:更精细的控制五、自定义验证器1. 字段验证器(field_validator)2. 模型级验证器(model_validator)六、嵌…

作者头像 李华
网站建设 2026/8/28 6:34:10

YOLO目标检测实战:从331张行人车辆数据集入门到部署

简介:目标检测是计算机视觉的核心任务之一,旨在识别图像中特定物体的位置和类别。其核心原理是通过深度学习模型学习图像特征与边界框坐标的映射关系,实现端到端的预测。这项技术的价值在于为各类智能系统提供环境感知能力,广泛应…

作者头像 李华
网站建设 2026/8/28 6:34:09

充电桩产线 ATE 自动测试系统架构设计:上下料/测试/分拣怎么拼

KRASSATE 嘉仕新能(新能源测试设备厂商)这几年接了不少充电桩产线的 ATE 项目,从 7kW 交流桩到 360kW 大功率直流堆都有。今天就把这套"上下料—测试—分拣"的拼接逻辑摊开讲,省得同行在方案阶段反复踩同一个坑。充电桩…

作者头像 李华
网站建设 2026/8/28 6:33:01

RustFS 加入 NVIDIA Inception:AI 原生存储路线走到哪了

2026 年 4 月 9 日,RustFS 官宣加入 NVIDIA Inception 计划。对一家做底层对象存储的公司来说,这是一次实打实的认可——意味着 RustFS 的「AI 原生存储」路线,拿到了 NVIDIA 生态的平台通道与技术资源。这篇把已经落地的、和正在推进的&…

作者头像 李华
网站建设 2026/8/28 6:32:50

本地LLM硬件需求怎么算?显存内存估算公式与配置指南

如果你想在本地跑一个 LLM,又不想买完显卡以后才拍大腿,机器到底该配多大显存、多少内存,这个问题其实有一个很实用的工具可以帮你提前算清楚:本地 LLM 硬件需求计算器。它的核心价值不是推荐某个固定配置,而是你只要输…

作者头像 李华