最近,我在运行推理服务器时遇到了 triton 服务配置文件禁用标志“--strict-model-config=false”的解决方案。这将允许在从模型存储库加载模型时创建自己的配置文件。
sudo docker run --rm --net=host -p 8000:8000 -p 8001:8001 -p 8002:8002 \
-v /home/rajesh/custom_repository:/models nvcr.io/nvidia/tritonserver:22.06-py3 \
tritonserver --model-repository=/models --strict-model-config=false
Run Code Online (Sandbox Code Playgroud)
我想从 Triton 推理服务器获取生成的配置文件,因为我们可以使用批处理配置和其他参数。有没有办法获取我在服务器中加载的模型的内置生成的 config.pbtxt 文件,以便我可以调整批量大小和其他参数。
我正在尝试将非常大的图像输入 Triton 服务器。我需要将输入图像分成补丁并将补丁一个一个地输入到张量流模型中。图像大小可变,因此每次调用的补丁数 N 都是可变的。
我认为调用以下步骤的 Triton 集成模型可以完成这项工作:
但是,为此,我必须编写一个config. pbtxt具有1:N和N:1关系的文件,这意味着集成调度程序需要多次调用第二步,并使用聚合输出调用第三步。
这是可能的,还是我需要使用其他技术?
NVIDIA Triton \xc2\xa0vs\xc2\xa0 TorchServe \xc2\xa0 用于 SageMaker 推理?什么时候推荐每个?
\n两者都是现代的生产级推理服务器。TorchServe 是 PyTorch 模型的 DLC 默认推理服务器。SageMaker 上的 PyTorch 推理还支持 Triton。
\n有人有两者的良好比较矩阵吗?
\ntritonserver ×3
inference ×1
nvidia ×1
python ×1
tensorflow ×1
tensorrt ×1
torchserve ×1
triton ×1