Neural Engine
Blackmagic Design为DaVinci Resolve自研的AI推理框架,专为视频处理场景优化,支持NVIDIA CUDA、AMD ROCm及Apple Silicon等多种计算平台,针对色彩科学和视频编解码做深度适配
核心事实
时间轴 (近 90 天)
在140k上下文下,调用手机的神经引擎(Neural Engine)使每token的写入时间从279 ms降到176 ms
搭载 Apple Silicon(M 系列芯片)的 Mac 具备专用的神经网络引擎(Neural Engine),可低功耗运行数十亿参数级别的语言模型
Apple Silicon 神经网络引擎峰值算力可达每秒 15-38 万亿次操作(TOPS)
设备端OCR完全依赖本机CPU/GPU与Neural Engine完成推理,云端OCR则需将图片上传至服务器识别
神经核心专门执行矩阵乘法、卷积运算等深度学习推理任务
神经核心在处理同类AI计算时能效比相比通用CPU可高出数十倍
端侧模型可运行在手机的神经网络引擎上,如苹果的Neural Engine
苹果自A11 Bionic(2017年)起便集成Neural Engine,是业内最早大规模商用NPU的厂商之一
Neural Engine是Blackmagic Design自研的AI推理框架,可在NVIDIA CUDA、AMD ROCm以及Apple Silicon的Neural Engine硬件单元上运行
DaVinci Resolve通过内置Neural Engine引入智能重构图、语音转文字、面部识别分类、AI降噪与超分辨率等AI辅助能力
还有 12 条时间轴事件
全部知识事实 (20)
M4芯片的Neural Engine每秒可执行38万亿次运算(38 TOPS)
90%已验证苹果自A11 Bionic芯片起就内置了Neural Engine用于加速机器学习推理任务
80%已验证苹果Neural Engine自2017年A11 Bionic芯片首次亮相,A11每秒可执行6000亿次运算,A18 Pro芯片已达到每秒35万亿次
75%已验证Apple Intelligence设备端依托苹果自研的Neural Engine运行约30亿参数级别的小型语言模型处理本地任务,云端通过私有云计算架构调用更大规模模型
75%已验证M4芯片的Neural Engine峰值算力达到38 TOPS(每秒38万亿次运算)
65%已验证Apple Silicon的Neural Engine已能在M系列芯片上流畅运行数十亿参数模型,高通骁龙X Elite等端侧芯片专为AI推理优化
65%已验证苹果自研芯片中的神经网络引擎(Neural Engine)是专为矩阵乘法和卷积运算优化的NPU,在特定AI推理任务上比通用CPU和GPU具有更高能效比
65%已验证苹果M系列芯片中的Neural Engine本质上属于NPU
65%待验证苹果从A11仿生芯片开始持续提升端侧AI算力
90%待验证Apple Silicon Neural Engine的峰值算力从M1的11 TOPS跃升至M4的38 TOPS,性能提升超过3倍
90%待验证Foundation Models框架将大语言模型推理能力下沉到设备本地执行,而非依赖云端API调用
90%部分验证苹果A系列芯片为苹果自研,采用台积电最先进制程,GPU与神经网络引擎均自主设计,在同代能效比上长期保持领先
70%待验证Apple 自研芯片内置神经网络引擎,最新的 M4 系列提供高达 38 TOPS 的 AI 推理算力
60%待验证M2 Ultra集成的Neural Engine包含32个专用核心,理论算力可达31.6 TOPS
60%待验证Intel的Meteor Lake及后续架构、AMD的Ryzen AI系列以及Apple的Neural Engine都集成了NPU模块
60%待验证Neural Engine的设计哲学源自谷歌TPU(张量处理单元)的架构思路,但针对移动端和桌面端的功耗约束进行了优化
60%待验证在140k上下文下,调用手机的神经引擎(Neural Engine)使每token的写入时间从279 ms降到176 ms
50%待验证搭载 Apple Silicon(M 系列芯片)的 Mac 具备专用的神经网络引擎(Neural Engine),可低功耗运行数十亿参数级别的语言模型
50%待验证Apple Silicon 神经网络引擎峰值算力可达每秒 15-38 万亿次操作(TOPS)
50%待验证设备端OCR完全依赖本机CPU/GPU与Neural Engine完成推理,云端OCR则需将图片上传至服务器识别
50%