[KongchangAI]
Product

ONNX Runtime

ONNX Runtime是微软开源的跨平台高性能机器学习推理引擎,支持运行ONNX(Open Neural Network Exchange)格式的模型。它兼容多种操作系统和硬件加速器(如CPU、GPU、NPU),能够优化并加速来自PyTorch、TensorFlow等主流框架导出的模型推理,广泛应用于生产环境中的深度学习模型部署。

Core Facts

Timeline (last 90 days)

Oct 8

端侧AI的核心技术路径通常依赖轻量化模型框架,如ONNX Runtime、TensorFlow Lite或Apple的Core ML

Unverified50%
Oct 4

实现私有化部署通常要求模型权重可下载、推理框架支持本地运行(如 ONNX Runtime、vLLM、Triton Inference Server)

Unverified50%
Oct 3

配合 ONNX Runtime 或 llama.cpp 生态中的多模态模型,可在普通家用 CPU 上完成物种识别推理,无需调用云端 API

Unverified50%
Oct 2

本地推理的主流方案包括 llama.cpp、Ollama、ONNX Runtime 以及 Apple 的 Core ML

Unverified50%
Sep 7

一位Reddit开发者在树莓派上手写一个微型CNN,跑出了比ONNX Runtime、ncnn等主流推理引擎快3倍的性能

Unverified50%
Sep 6

边缘AI推理通常依赖TensorFlow Lite、ONNX Runtime、OpenVINO等轻量化推理框架

Unverified50%
Sep 6

TensorRT通过算子融合、内核自动调优和内存优化来释放GPU硬件潜力

Verified80%
Sep 1

本地推理生态由硬件(NVIDIA Jetson系列、Google Coral TPU、Apple Silicon和高通骁龙NPU)和软件(ONNX Runtime、TensorRT、llama.cpp)支撑

Unverified50%
Sep 1

主流边缘推理框架包括谷歌的TensorFlow Lite、微软主导的ONNX Runtime、以及陈天奇团队开发的MLC-LLM

Unverified50%
Aug 31

CV工程师的完整技术栈包括数据采集标注、模型架构选择与训练、推理优化(如TensorRT、ONNX Runtime进行模型量化和加速)、边缘设备部署(如NVIDIA Jetson或高通芯片)

Unverified50%

12 more timeline events

All Facts (20)

Verified

TensorRT通过算子融合、内核自动调优和内存优化来释放GPU硬件潜力

80%
Verified

Triton Inference Server是NVIDIA开源的模型服务化框架,支持动态批处理、模型并发执行,兼容TensorRT、PyTorch、TensorFlow、ONNX Runtime等推理后端

80%
Verified

ONNX Runtime 是微软主导开发的开源机器学习推理与训练加速引擎

75%
Verified

ONNX Runtime是微软开源的高性能推理引擎,支持CPU、GPU、NPU等多种硬件后端,并内置图优化、算子融合等加速手段

65%
Verified

TensorRT是NVIDIA开发的推理引擎,ONNX Runtime是微软开发的推理引擎

65%
Unverified

FastEmbed采用ONNX Runtime作为推理引擎,不需要依赖PyTorch或TensorFlow

95%
Unverified

ONNX Runtime employs a layered architecture of graph optimization plus Execution Providers to support multiple hardware backends

85%
Unverified

ONNX Runtime的图优化分为三个层级:基础优化、扩展优化和全量优化

60%
Unverified

ONNX Runtime的核心架构是可插拔的执行提供程序(Execution Provider)体系,包括CPU EP、CUDA EP、TensorRT EP、DirectML EP和CoreML EP等

60%
Unverified

端侧AI的核心技术路径通常依赖轻量化模型框架,如ONNX Runtime、TensorFlow Lite或Apple的Core ML

50%
Unverified

实现私有化部署通常要求模型权重可下载、推理框架支持本地运行(如 ONNX Runtime、vLLM、Triton Inference Server)

50%
Unverified

配合 ONNX Runtime 或 llama.cpp 生态中的多模态模型,可在普通家用 CPU 上完成物种识别推理,无需调用云端 API

50%
Unverified

本地推理的主流方案包括 llama.cpp、Ollama、ONNX Runtime 以及 Apple 的 Core ML

50%
Unverified

一位Reddit开发者在树莓派上手写一个微型CNN,跑出了比ONNX Runtime、ncnn等主流推理引擎快3倍的性能

50%
Unverified

边缘AI推理通常依赖TensorFlow Lite、ONNX Runtime、OpenVINO等轻量化推理框架

50%
Unverified

本地推理生态由硬件(NVIDIA Jetson系列、Google Coral TPU、Apple Silicon和高通骁龙NPU)和软件(ONNX Runtime、TensorRT、llama.cpp)支撑

50%
Unverified

主流边缘推理框架包括谷歌的TensorFlow Lite、微软主导的ONNX Runtime、以及陈天奇团队开发的MLC-LLM

50%
Unverified

CV工程师的完整技术栈包括数据采集标注、模型架构选择与训练、推理优化(如TensorRT、ONNX Runtime进行模型量化和加速)、边缘设备部署(如NVIDIA Jetson或高通芯片)

50%
Unverified

推理框架通过量化(将FP32权重压缩为INT8甚至INT4)和算子融合等优化手段,让模型在消费级设备上实时执行

50%
Unverified

ONNX Runtime的C++ API支持多种执行提供者,包括CUDA、TensorRT、DirectML,在Windows上与DirectML结合可利用各品牌GPU计算能力

50%

Source Articles