ONNX Runtime
ONNX Runtime是微软开源的跨平台高性能机器学习推理引擎,支持运行ONNX(Open Neural Network Exchange)格式的模型。它兼容多种操作系统和硬件加速器(如CPU、GPU、NPU),能够优化并加速来自PyTorch、TensorFlow等主流框架导出的模型推理,广泛应用于生产环境中的深度学习模型部署。
Core Facts
Timeline (last 90 days)
端侧AI的核心技术路径通常依赖轻量化模型框架,如ONNX Runtime、TensorFlow Lite或Apple的Core ML
实现私有化部署通常要求模型权重可下载、推理框架支持本地运行(如 ONNX Runtime、vLLM、Triton Inference Server)
配合 ONNX Runtime 或 llama.cpp 生态中的多模态模型,可在普通家用 CPU 上完成物种识别推理,无需调用云端 API
本地推理的主流方案包括 llama.cpp、Ollama、ONNX Runtime 以及 Apple 的 Core ML
一位Reddit开发者在树莓派上手写一个微型CNN,跑出了比ONNX Runtime、ncnn等主流推理引擎快3倍的性能
边缘AI推理通常依赖TensorFlow Lite、ONNX Runtime、OpenVINO等轻量化推理框架
TensorRT通过算子融合、内核自动调优和内存优化来释放GPU硬件潜力
本地推理生态由硬件(NVIDIA Jetson系列、Google Coral TPU、Apple Silicon和高通骁龙NPU)和软件(ONNX Runtime、TensorRT、llama.cpp)支撑
主流边缘推理框架包括谷歌的TensorFlow Lite、微软主导的ONNX Runtime、以及陈天奇团队开发的MLC-LLM
CV工程师的完整技术栈包括数据采集标注、模型架构选择与训练、推理优化(如TensorRT、ONNX Runtime进行模型量化和加速)、边缘设备部署(如NVIDIA Jetson或高通芯片)
12 more timeline events
All Facts (20)
TensorRT通过算子融合、内核自动调优和内存优化来释放GPU硬件潜力
80%VerifiedTriton Inference Server是NVIDIA开源的模型服务化框架,支持动态批处理、模型并发执行,兼容TensorRT、PyTorch、TensorFlow、ONNX Runtime等推理后端
80%VerifiedONNX Runtime 是微软主导开发的开源机器学习推理与训练加速引擎
75%VerifiedONNX Runtime是微软开源的高性能推理引擎,支持CPU、GPU、NPU等多种硬件后端,并内置图优化、算子融合等加速手段
65%VerifiedTensorRT是NVIDIA开发的推理引擎,ONNX Runtime是微软开发的推理引擎
65%UnverifiedFastEmbed采用ONNX Runtime作为推理引擎,不需要依赖PyTorch或TensorFlow
95%UnverifiedONNX Runtime employs a layered architecture of graph optimization plus Execution Providers to support multiple hardware backends
85%UnverifiedONNX Runtime的图优化分为三个层级:基础优化、扩展优化和全量优化
60%UnverifiedONNX Runtime的核心架构是可插拔的执行提供程序(Execution Provider)体系,包括CPU EP、CUDA EP、TensorRT EP、DirectML EP和CoreML EP等
60%Unverified端侧AI的核心技术路径通常依赖轻量化模型框架,如ONNX Runtime、TensorFlow Lite或Apple的Core ML
50%Unverified实现私有化部署通常要求模型权重可下载、推理框架支持本地运行(如 ONNX Runtime、vLLM、Triton Inference Server)
50%Unverified配合 ONNX Runtime 或 llama.cpp 生态中的多模态模型,可在普通家用 CPU 上完成物种识别推理,无需调用云端 API
50%Unverified本地推理的主流方案包括 llama.cpp、Ollama、ONNX Runtime 以及 Apple 的 Core ML
50%Unverified一位Reddit开发者在树莓派上手写一个微型CNN,跑出了比ONNX Runtime、ncnn等主流推理引擎快3倍的性能
50%Unverified边缘AI推理通常依赖TensorFlow Lite、ONNX Runtime、OpenVINO等轻量化推理框架
50%Unverified本地推理生态由硬件(NVIDIA Jetson系列、Google Coral TPU、Apple Silicon和高通骁龙NPU)和软件(ONNX Runtime、TensorRT、llama.cpp)支撑
50%Unverified主流边缘推理框架包括谷歌的TensorFlow Lite、微软主导的ONNX Runtime、以及陈天奇团队开发的MLC-LLM
50%UnverifiedCV工程师的完整技术栈包括数据采集标注、模型架构选择与训练、推理优化(如TensorRT、ONNX Runtime进行模型量化和加速)、边缘设备部署(如NVIDIA Jetson或高通芯片)
50%Unverified推理框架通过量化(将FP32权重压缩为INT8甚至INT4)和算子融合等优化手段,让模型在消费级设备上实时执行
50%UnverifiedONNX Runtime的C++ API支持多种执行提供者,包括CUDA、TensorRT、DirectML,在Windows上与DirectML结合可利用各品牌GPU计算能力
50%