图中从左至右依次为原始输入图像、KATok重建结果,以及重建过程中使用的Token示意。即使去掉黑色标注的Token,画面质量也未受明显影响,同时计算效率得到提升。图片来源:Kakao

Kakao公开了一项提升视频生成效率的新技术。该技术可根据视频内容的复杂程度动态调整所需Token数量,从而减少生成过程中的计算开销。实验结果显示,相关视频生成模型训练速度提升约6.9倍,生成速度提升约3.2倍。

Kakao于9日表示,将在计算机视觉国际学术会议“欧洲计算机视觉大会(ECCV)2026”上公开自适应视频Token化技术“KATok(Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation)”。

ECCV与计算机视觉与模式识别会议(CVPR)、国际计算机视觉大会(ICCV)并称全球三大计算机视觉会议。本届大会在瑞典举行,会期持续至12日。该论文将由主导研究的Kakao Research工程师 Lee Yeon-gyeong 于当地时间10日发表。

据介绍,KATok可根据视频中的运动变化和信息密度,自动调整计算所需的Token数量。对于运动更剧烈、信息更密集的画面,系统会分配更多Token;对于变化较小的区域,则压缩冗余Token。

现有视频Token化方案通常不区分具体内容,而是按照固定比例压缩数据。这意味着即便在运动较少的场景中,系统仍会生成相同规模的Token。随着分辨率提高、视频时长增加,模型还需要处理大量不必要的Token,计算负担也随之上升。

Kakao表示,KATok的核心在于减少视频帧之间的重复数据,以降低上述计算开销。该系统无需人工预设Token数量,而是由模型根据视频的时空复杂度自动决定所需的计算规模。

实验显示,在视频重建过程中,KATok所需的Token数量少于现有Dense Tokenizer方案。将其应用于视频生成全流程后,视频生成模型训练速度提升约6.9倍,生成速度提升约3.2倍。

Kakao称,KATok不仅提升了Token压缩阶段的效率,还可与视频生成模型结合,从而提高整体生成流程的计算效率。下一步,公司将继续优化KATok,并推动其应用至更高分辨率和长视频生成场景。

Kakao Applied AI模型成果负责人 Choi Dong-jin 表示,在高分辨率、长视频等计算需求更高的场景中,KATok带来的算力节省效果将更加明显。公司还将验证其在多种AI视频生成模型中的通用性,推动其发展为大规模视频生成的底层技术。

关键词

#Kakao #ECCV 2026 #KATok #自适应视频Token化 #视频生成 #计算效率 #Dense Tokenizer #计算机视觉
版权所有 © DigitalToday。未经授权禁止转载或传播。