51 lines
3.1 KiB
Bash
51 lines
3.1 KiB
Bash
# 选择已经下载到 demo/models 目录中的 ASR 模型;必须与实际模型目录保持一致。
|
||
# 默认使用轻量的 0.6B 模型。如下载的是 1.7B,请改为 1.7b,不能混用。
|
||
QWEN3_ASR_MODEL=0.6b
|
||
# 本地模型根目录。下载脚本、VLLM 启动脚本和辅助服务都会从这里查找模型。
|
||
MODEL_DIR=D:/github-project/ASR/Qwen-Asr/demo/models
|
||
|
||
# VLLM 宿主机服务绑定地址;0.0.0.0 表示允许服务器网卡接收外部请求。
|
||
VLLM_HOST=0.0.0.0
|
||
# VLLM 服务端口;启动器、健康检查和前端连接地址必须使用同一个端口。
|
||
VLLM_PORT=9950
|
||
# VLLM 可执行文件名称;新版环境通常为 vllm,启动器会自动执行 vllm serve。
|
||
VLLM_EXECUTABLE=vllm
|
||
# 启动成功提示中显示的地址,只影响日志和使用说明,不改变实际监听地址。
|
||
VLLM_DISPLAY_HOST=127.0.0.1
|
||
# 启动轮询使用的地址;如果 VLLM 部署在本机,通常保持 127.0.0.1 即可。
|
||
VLLM_PROBE_HOST=127.0.0.1
|
||
# VLLM 启动阶段最多检查多少次健康状态,超过次数仍未就绪则启动失败。
|
||
VLLM_STARTUP_CHECK_LOOPS=60
|
||
# 两次健康检查之间的等待秒数;模型加载较慢时可以适当增大检查次数。
|
||
VLLM_STARTUP_CHECK_INTERVAL_SECONDS=2
|
||
# VLLM 使用的显存比例。显存还要留给 VAD、聚类和声纹辅助模型时,建议预留余量。
|
||
VLLM_GPU_MEMORY_UTILIZATION=0.3
|
||
# VLLM 的最大上下文长度;数值越大通常占用越多显存,请结合显卡容量调整。
|
||
VLLM_MAX_MODEL_LEN=16384
|
||
# VLLM 同时处理的最大序列数;实时单路验证可保持默认值,多路并发时再调大。
|
||
VLLM_MAX_NUM_SEQS=16
|
||
# 张量并行 GPU 数量;单卡部署为 1,多卡部署时填写参与并行的 GPU 数量。
|
||
VLLM_TENSOR_PARALLEL_SIZE=1
|
||
# 是否启用 eager 模式。true 通常更容易启动和排查,false 可能获得更高性能。
|
||
VLLM_ENFORCE_EAGER=true
|
||
|
||
# GB10 需要使用 CUDA 13 工具链中的 ptxas;serve.py 会自动加载该配置并传给 VLLM。
|
||
TRITON_PTXAS_PATH=/usr/local/cuda/bin/ptxas
|
||
|
||
# 可选:为外部客户端设置稳定的公开模型名称。留空时默认使用完整 ModelScope ID。
|
||
# VLLM_SERVED_MODEL_NAME=Qwen/Qwen3-ASR-0.6B
|
||
|
||
# 辅助模型服务地址;它独立加载 VAD、CAM++ 聚类和声纹模型,WebSocket
|
||
# 服务只通过 HTTP 调用,不会把这些 GPU 模型重复加载到 WebSocket 进程。
|
||
AUXILIARY_SERVICE_URL=http://127.0.0.1:8010
|
||
# WebSocket 调用已独立部署的 vLLM;跨服务器时改成模型服务器的实际地址。
|
||
MODEL_SERVICE_URL=http://127.0.0.1:9950/v1
|
||
# 辅助服务监听的 GPU;单卡服务器保持 cuda:0,多卡时可改成指定卡号。
|
||
AUXILIARY_DEVICE=cuda:0
|
||
# 仅保留兼容旧配置;VAD/CAM++ 核心模型缺失时始终拒绝启动,不会静默降级。
|
||
# 可选 diarization/aligner 缺失不会阻断实时服务。
|
||
AUXILIARY_ALLOW_MISSING=false
|
||
# 启动时强制加载 VAD + CAM++ speaker_verification;完整 diarization 首次调用时按需加载。
|
||
# 如确实需要启动时额外预加载,可追加:vad,speaker_verification,diarization
|
||
AUXILIARY_PRELOAD_KINDS=vad,speaker_verification
|