ONNX
ONNX(Open Neural Network Exchange,开放神经网络交换格式)是由微软和Facebook联合发起的开放标准,用于表示机器学习模型的通用中间格式。它定义了一套通用的算子集合和数据类型规范,使模型能够在PyTorch、TensorFlow等不同训练框架之间相互转换,并通过ONNX Runtime等推理引擎在多种硬件平台上部署,从而解决深度学习框架互操作性问题。
核心事实
时间轴 (近 90 天)
ONNX是与框架无关的神经网络模型交换格式,TensorRT接收ONNX模型后根据目标GPU执行层融合、算子选择等优化,生成设备专属的序列化执行引擎
TensorRT RTX的典型工作流为:训练框架导出ONNX,TensorRT解析并优化计算图,生成针对目标GPU的序列化引擎文件(.engine/.plan)
ONNX(Open Neural Network Exchange)由微软和Facebook于2017年联合推出,现已成为业界事实标准的跨框架模型交换格式
ONNX Runtime Web是微软主导的跨平台推理引擎的浏览器版本,能直接加载标准ONNX格式模型
MLC-LLM、Transformers.js 等开源框架专门针对浏览器端推理场景优化,能将ONNX、GGUF等格式的模型权重加载到浏览器内存并执行推理
不同架构的 GPU(NVIDIA 与 Apple Silicon)指令集不同,要在同一推理任务中协同通常需要统一的中间表示层(如 ONNX 或 llama.cpp 的跨平台后端)
PAANI最终选用的FP32 ONNX模型仅占用14.817 MB
ONNX 是由微软和 Facebook 联合推动的开放模型交换格式,允许将 PyTorch、TensorFlow 等框架的模型导出为统一的 .onnx 文件
Model Connect 部署流程无需 ONNX 转换,也不需要自己编写自回归推理循环
在ONNX中使用INT8权重配合INT4嵌入层的量化组合,相比精度更保守的量化版本,F1分数差异仅约0.005
还有 14 条时间轴事件
全部知识事实 (20)
ONNX Runtime 是微软主导开发的开源机器学习推理与训练加速引擎
75%已验证ONNX 最初由微软和 Facebook(现 Meta)于 2017 年联合发起
70%已验证ONNX(Open Neural Network Exchange)格式允许将PyTorch/TensorFlow模型导出为跨平台的中间表示格式
65%待验证MoS-TTS-Nano使用ONNX(Open Neural Network Exchange)格式进行CPU上的高效推理
95%待验证TensorFlow导出ONNX需要使用tf2onnx库
95%待验证Transformers框架同时支持PyTorch和TensorFlow后端,并通过ONNX等格式支持更广泛的部署场景
90%待验证ONNX模型导出后,只要保持相同的input_names和output_names,推理代码就是完全通用的,无论模型来自PyTorch还是TensorFlow
90%待验证TensorFlow导出ONNX时不需要提供dummy数据,因为tf.function通过AutoGraph将Python代码编译为静态图,input_signature提供的类型和形状信息足以完整描述计算图结构
90%待验证onnxruntime-genai包可以用于ONNX格式模型的生成式AI推理
85%待验证2019年,ONNX被移交给Linux基金会旗下的LF AI & Data基金会管理
85%待验证ONNX(Open Neural Network Exchange)诞生于2017年,最初由Facebook(Meta)和Microsoft联合开发
85%待验证许多HuggingFace模型仓库已经提供了ONNX版本,特别是针对CPU和移动端优化的量化模型
80%待验证ONNX已获得Amazon、Intel、NVIDIA、Qualcomm等数十家主流硬件和软件厂商的支持
80%部分验证ONNX由微软和Facebook于2017年联合发起,目前已成为AI模型互操作的事实标准
75%待验证TensorRT是NVIDIA推出的高性能深度学习推理优化器与运行时,自2015年发布
70%待验证ONNX是与框架无关的神经网络模型交换格式,TensorRT接收ONNX模型后根据目标GPU执行层融合、算子选择等优化,生成设备专属的序列化执行引擎
50%待验证TensorRT RTX的典型工作流为:训练框架导出ONNX,TensorRT解析并优化计算图,生成针对目标GPU的序列化引擎文件(.engine/.plan)
50%待验证ONNX(Open Neural Network Exchange)由微软和Facebook于2017年联合推出,现已成为业界事实标准的跨框架模型交换格式
50%待验证ONNX Runtime Web是微软主导的跨平台推理引擎的浏览器版本,能直接加载标准ONNX格式模型
50%待验证MLC-LLM、Transformers.js 等开源框架专门针对浏览器端推理场景优化,能将ONNX、GGUF等格式的模型权重加载到浏览器内存并执行推理
50%