33B参数规模的混合注意力多模态模型,支持262,144 token超长上下文窗口,采用3:1混合注意力架构(门控delta rule循环层与全局注意力层交替),支持文本、图像、视频的联合理解及工具调用