# 选择已经下载到 demo/models 目录中的 ASR 模型;必须与实际模型目录保持一致。 # 默认使用轻量的 0.6B 模型。如下载的是 1.7B,请改为 1.7b,不能混用。 QWEN3_ASR_MODEL=0.6b # 本地模型根目录。下载脚本、VLLM 启动脚本和辅助服务都会从这里查找模型。 MODEL_DIR=D:/github-project/ASR/Qwen-Asr/demo/models # VLLM 宿主机服务绑定地址;0.0.0.0 表示允许服务器网卡接收外部请求。 VLLM_HOST=0.0.0.0 # VLLM 服务端口;启动器、健康检查和前端连接地址必须使用同一个端口。 VLLM_PORT=9950 # VLLM 可执行文件名称;新版环境通常为 vllm,启动器会自动执行 vllm serve。 VLLM_EXECUTABLE=vllm # 启动成功提示中显示的地址,只影响日志和使用说明,不改变实际监听地址。 VLLM_DISPLAY_HOST=127.0.0.1 # 启动轮询使用的地址;如果 VLLM 部署在本机,通常保持 127.0.0.1 即可。 VLLM_PROBE_HOST=127.0.0.1 # VLLM 启动阶段最多检查多少次健康状态,超过次数仍未就绪则启动失败。 VLLM_STARTUP_CHECK_LOOPS=60 # 两次健康检查之间的等待秒数;模型加载较慢时可以适当增大检查次数。 VLLM_STARTUP_CHECK_INTERVAL_SECONDS=2 # VLLM 使用的显存比例。显存还要留给 VAD、聚类和声纹辅助模型时,建议预留余量。 VLLM_GPU_MEMORY_UTILIZATION=0.3 # VLLM 的最大上下文长度;数值越大通常占用越多显存,请结合显卡容量调整。 VLLM_MAX_MODEL_LEN=16384 # VLLM 同时处理的最大序列数;实时单路验证可保持默认值,多路并发时再调大。 VLLM_MAX_NUM_SEQS=16 # 张量并行 GPU 数量;单卡部署为 1,多卡部署时填写参与并行的 GPU 数量。 VLLM_TENSOR_PARALLEL_SIZE=1 # 是否启用 eager 模式。true 通常更容易启动和排查,false 可能获得更高性能。 VLLM_ENFORCE_EAGER=true # GB10 需要使用 CUDA 13 工具链中的 ptxas;serve.py 会自动加载该配置并传给 VLLM。 TRITON_PTXAS_PATH=/usr/local/cuda/bin/ptxas # 可选:为外部客户端设置稳定的公开模型名称。留空时默认使用完整 ModelScope ID。 # VLLM_SERVED_MODEL_NAME=Qwen/Qwen3-ASR-0.6B # 辅助模型服务地址;它独立加载 VAD、CAM++ 聚类和声纹模型,WebSocket # 服务只通过 HTTP 调用,不会把这些 GPU 模型重复加载到 WebSocket 进程。 AUXILIARY_SERVICE_URL=http://127.0.0.1:8010 # WebSocket 调用已独立部署的 vLLM;跨服务器时改成模型服务器的实际地址。 MODEL_SERVICE_URL=http://127.0.0.1:9950/v1 # 辅助服务监听的 GPU;单卡服务器保持 cuda:0,多卡时可改成指定卡号。 AUXILIARY_DEVICE=cuda:0 # 仅保留兼容旧配置;VAD/CAM++ 核心模型缺失时始终拒绝启动,不会静默降级。 # 可选 diarization/aligner 缺失不会阻断实时服务。 AUXILIARY_ALLOW_MISSING=false # 启动时强制加载 VAD + CAM++ speaker_verification;完整 diarization 首次调用时按需加载。 # 如确实需要启动时额外预加载,可追加:vad,speaker_verification,diarization AUXILIARY_PRELOAD_KINDS=vad,speaker_verification