我的显卡4张95g的h20
本地模型地址:/mnt/afs/share_models/git_models/Qwen/Qwen3-235B-A22B/
我的机器是8卡,我只用前0123卡
max-model-len需要设置吗?如果不设置会怎么样,如果需要设置的话就设置成8k
我已经启用qwen3-32b的模型cli serve,现在能给我一个在本地调用方法吗,特别是需要batch推理方面的
你可以直接用OpenAI API格式本地请求vLLM serve启动的服务,支持batch推理。只需向/v1/chat/completions或/v1/completions接口发送POST请求,body中包含多条messages或prompts即可。
例如,使用Python requests库:
import requests
url = "http://localhost:8000/v1/chat/completions"
headers = {"Content-Type": "application/json"}
data = {
"model": "Qwen3-32B",
"messages": [
[{"role": "user", "content": "问题1"}],
[{"role": "user", "content": "问题2"}]
],
"max_tokens": 128
}
response = requests.post(url, headers=headers, json=data)
print(response.json())
batch大小由max_num_seqs参数控制,详见官方文档和issue说明。
需要更详细的代码或参数说明吗?
Sources:
我有一个问题
如果是offline pipeline
batch的推理的实现方式是一次输入多个问题是吗
如果是cli serve
batch推理的实现方式 是一次发送多个request,每个request一个请求是吗
服务端:
INFO: 127.0.0.1:59554 - “GET /health HTTP/1.1” 200 OK
INFO: 127.0.0.1:59554 - “POST /v1/chat/completions HTTP/1.1” 400 Bad Request
INFO: 127.0.0.1:59554 - “POST /v1/chat/completions HTTP/1.1” 400 Bad Request
INFO: 127.0.0.1:59554 - “POST /v1/chat/completions HTTP/1.1” 400 Bad Request
INFO: 127.0.0.1:59624 - “POST /v1/chat/completions HTTP/1.1” 400 Bad Request
INFO: 127.0.0.1:59624 - “POST /v1/chat/completions HTTP/1.1” 400 Bad Request
你的服务端日志显示/v1/chat/completions接口多次返回400 Bad Request,说明请求参数有误或格式不符合API要求。常见原因包括:messages字段格式错误、缺少model参数、max_tokens非法、输入超出max-model-len等。官方文档有详细参数说明。
建议检查请求体格式,确保messages为列表、每条消息有role和content字段,且model参数正确。可参考如下格式:
{
"model": "你的模型名",
"messages": [
{"role": "user", "content": "你好"}
],
"max_tokens": 128
}
需要更详细的排查步骤或错误日志分析吗?
Sources:
这个方式到底支持batch推理吗?
给我推荐一个最合适的调用QWEN3-32b的批量推理的格式
/v1/chat/completions接口本身不支持一次请求内多组messages(即不支持原生batch),每次请求只能推理一组对话。官方说明明确指出chat接口不支持batch,只能并发多请求,服务端会自动调度batch。
最推荐的Qwen3-32B批量推理方式:用多线程/多进程/异步并发方式,分别发送多个单条messages的POST请求到/v1/chat/completions,服务端会自动合并batch推理。格式如下:
{
"model": "Qwen3-32B",
"messages": [
{"role": "user", "content": "问题1"}
],
"max_tokens": 128
}
每个请求只放一组messages,批量推理靠客户端并发实现。参考
需要并发代码示例或更详细说明吗?
Sources: