Unverified50% confidenceFactExact time
VideOCR 是专门针对视频字幕OCR场景设计的处理库,通过帧差分检测字幕变化、多帧结果融合去重并生成时间戳
1
Sources
50%
Confidence
Long-term
Relevance
8/17/2026
First Seen
Sources
Related Claims
UnverifiedVideoViT 是将 Vision Transformer 架构扩展至视频域的技术路线,通过在时间维度引入注意力机制建模帧间关系,并使用 Tubelet Embedding 将连续帧时空体素化为三维 patch69% similarUnverified视频VQ-VAE、3D卷积、均匀采样关键帧后用ViT编码是主流的视频token化方法66% similarUnverifiedQwen VL的视觉编码器基于ViT(Vision Transformer)架构,将图像像素信息压缩编码为语言模型可理解的token序列65% similarUnverified视频超分辨率(VSR)通过光流估计对齐相邻帧并融合多帧信息重建目标帧,在恢复细节的同时保证时序稳定性64% similarPartially VerifiedVideoIn项目为Claude Code提供底层视频处理能力,包括音频提取、语音识别、时间轴分析、片段剪辑、字幕渲染等功能64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/763744API
curl https://kongchang.com/api/v1/knowledge/claims/763744MCP
get_claim(id=763744)