CHENGMING
返回资讯

AI 推理框架技术选型

对比 ONNX Runtime、TensorRT、vLLM 在企业场景下的性能表现。

在未央管理贰的 AI 模块开发过程中,推理框架的选型直接决定了系统能够承载的模型规模、响应延迟与部署成本。2026 年 5 月中旬,承明科技技术团队完成了一轮系统性的推理框架选型评估,围绕 ONNX Runtime、TensorRT 与 vLLM 三种主流方案,在企业级真实负载下进行了完整的 Benchmark,而非依赖官方公布的实验室数据。

评估维度涵盖首 token 延迟、并发吞吐量、显存占用、批处理能力、量化支持与部署复杂度六个方面。测试结果显示,在 LLM 推理场景下,vLLM 凭借 PagedAttention 机制在并发吞吐上具有显著优势,能够在大批量请求下保持稳定的延迟表现,更适合未央管理贰中智能审批与知识库问答这类高并发场景;TensorRT 在计算机视觉模型的推理延迟上表现最优,尤其适合 OCR 与文档结构化识别这类离线任务;ONNX Runtime 作为通用方案,在跨平台部署与轻量模型推理上依然保有不可替代的灵活性,是兜底与过渡场景的稳妥选择。

基于评估结果,承明科技最终确定以 vLLM 作为 LLM 推理引擎、TensorRT 负责 CV 模型推理的双轨方案,两者通过统一的模型仓库与监控告警体系进行调度。这一选型不仅在当前业务规模下提供了最优的性价比,也为后续模型迭代与多模态能力扩展预留了充足的工程余量。完整的评估报告与测试数据将在后续技术文章中公开,供同样面临选型决策的团队参考。

较新 · NEWER承明科技官网全新上线较早 · OLDER未央管理壹·稳定版发布

想聊聊这些动态背后的故事?

联系我们,获取第一手的产品进展与合作机会。

联系承明