登录社区云,与社区用户共同成长
邀请您加入社区
昇腾CANN平台上的ops-transformer算子库近期验证了FlashAttention在长视频理解任务中的突破性优化,让VideoMAE-large模型能够一次性处理长达60分钟的视频,而之前的限制是2分钟。视频数据的核心挑战是:每秒视频产生30帧图像,每分钟就有1800帧,Attention计算量是文本的100倍(因为每帧是一个token)。标准FlashAttention的O(N²)复