[控场AI]
概念Open Neural Network Exchange

ONNX

ONNX(Open Neural Network Exchange,开放神经网络交换格式)是由微软和Facebook联合发起的开放标准,用于表示机器学习模型的通用中间格式。它定义了一套通用的算子集合和数据类型规范,使模型能够在PyTorch、TensorFlow等不同训练框架之间相互转换,并通过ONNX Runtime等推理引擎在多种硬件平台上部署,从而解决深度学习框架互操作性问题。

核心事实

时间轴 (近 90 天)

10月3日

ONNX是与框架无关的神经网络模型交换格式,TensorRT接收ONNX模型后根据目标GPU执行层融合、算子选择等优化,生成设备专属的序列化执行引擎

待验证50%
10月1日

TensorRT RTX的典型工作流为:训练框架导出ONNX,TensorRT解析并优化计算图,生成针对目标GPU的序列化引擎文件(.engine/.plan)

待验证50%
10月1日

ONNX(Open Neural Network Exchange)由微软和Facebook于2017年联合推出,现已成为业界事实标准的跨框架模型交换格式

待验证50%
9月30日

ONNX Runtime Web是微软主导的跨平台推理引擎的浏览器版本,能直接加载标准ONNX格式模型

待验证50%
9月28日

MLC-LLM、Transformers.js 等开源框架专门针对浏览器端推理场景优化,能将ONNX、GGUF等格式的模型权重加载到浏览器内存并执行推理

待验证50%
9月25日

不同架构的 GPU(NVIDIA 与 Apple Silicon)指令集不同,要在同一推理任务中协同通常需要统一的中间表示层(如 ONNX 或 llama.cpp 的跨平台后端)

待验证50%
9月23日

PAANI最终选用的FP32 ONNX模型仅占用14.817 MB

待验证50%
9月19日

ONNX 是由微软和 Facebook 联合推动的开放模型交换格式,允许将 PyTorch、TensorFlow 等框架的模型导出为统一的 .onnx 文件

待验证50%
9月18日

Model Connect 部署流程无需 ONNX 转换,也不需要自己编写自回归推理循环

待验证50%
9月12日

在ONNX中使用INT8权重配合INT4嵌入层的量化组合,相比精度更保守的量化版本,F1分数差异仅约0.005

待验证50%

还有 14 条时间轴事件

全部知识事实 (20)

已验证

ONNX Runtime 是微软主导开发的开源机器学习推理与训练加速引擎

75%
已验证

ONNX 最初由微软和 Facebook(现 Meta)于 2017 年联合发起

70%
已验证

ONNX(Open Neural Network Exchange)格式允许将PyTorch/TensorFlow模型导出为跨平台的中间表示格式

65%
待验证

MoS-TTS-Nano使用ONNX(Open Neural Network Exchange)格式进行CPU上的高效推理

95%
待验证

TensorFlow导出ONNX需要使用tf2onnx库

95%
待验证

Transformers框架同时支持PyTorch和TensorFlow后端,并通过ONNX等格式支持更广泛的部署场景

90%
待验证

ONNX模型导出后,只要保持相同的input_names和output_names,推理代码就是完全通用的,无论模型来自PyTorch还是TensorFlow

90%
待验证

TensorFlow导出ONNX时不需要提供dummy数据,因为tf.function通过AutoGraph将Python代码编译为静态图,input_signature提供的类型和形状信息足以完整描述计算图结构

90%
待验证

onnxruntime-genai包可以用于ONNX格式模型的生成式AI推理

85%
待验证

2019年,ONNX被移交给Linux基金会旗下的LF AI & Data基金会管理

85%
待验证

ONNX(Open Neural Network Exchange)诞生于2017年,最初由Facebook(Meta)和Microsoft联合开发

85%
待验证

许多HuggingFace模型仓库已经提供了ONNX版本,特别是针对CPU和移动端优化的量化模型

80%
待验证

ONNX已获得Amazon、Intel、NVIDIA、Qualcomm等数十家主流硬件和软件厂商的支持

80%
部分验证

ONNX由微软和Facebook于2017年联合发起,目前已成为AI模型互操作的事实标准

75%
待验证

TensorRT是NVIDIA推出的高性能深度学习推理优化器与运行时,自2015年发布

70%
待验证

ONNX是与框架无关的神经网络模型交换格式,TensorRT接收ONNX模型后根据目标GPU执行层融合、算子选择等优化,生成设备专属的序列化执行引擎

50%
待验证

TensorRT RTX的典型工作流为:训练框架导出ONNX,TensorRT解析并优化计算图,生成针对目标GPU的序列化引擎文件(.engine/.plan)

50%
待验证

ONNX(Open Neural Network Exchange)由微软和Facebook于2017年联合推出,现已成为业界事实标准的跨框架模型交换格式

50%
待验证

ONNX Runtime Web是微软主导的跨平台推理引擎的浏览器版本,能直接加载标准ONNX格式模型

50%
待验证

MLC-LLM、Transformers.js 等开源框架专门针对浏览器端推理场景优化,能将ONNX、GGUF等格式的模型权重加载到浏览器内存并执行推理

50%

来源文章