视觉预训练什么时候能迎来 next token prediction 时刻?
发布时间:2026/9/5 9:59:17 锦皓数字建站

TL;DR:生成侧的时刻已经来了(2024 年,以 VAR 拿到 NeurIPS 2024 Best Paper 为标志);理解侧的时刻正在路上,但大概率不会长成 NLP 的样子。它更像是一场"被统一多模态大模型从侧面接管"的渐进收敛,而不是纯视觉预训练内部某一天突然的"ChatGPT 时刻"。下面展开说。一、先对齐概念:NLP 的"next token prediction 时刻"到底是什么要回答"什么时候",得先定义"时刻"。NLP 里这个"时刻"通常指一件事:GPT 路线靠"预测下一个 token"这一个目标,同时拿到了 scaling law 和零样本/少样本涌现能力,最终把 BERT 那套"掩码重建"路线按在了地上。两条路线其实是同源的,对照关系很清楚:对照项BERT 路线GPT 路线预训练目标掩码 token 预测(双向)下一个 token 预测(因果)代表模型BERT、RoBERTaGPT-1/2/3、Llama、Qwen胜利原因理解任务精度高目标简单、可无限扩展、天然统一理解与生成、涌现能力BERT 2018 年发,GPT-3 2020 年发,ChatGPT 2022 年引爆——"时刻"不是某个模型发布那天,而是当"预测下一个 token"被证明既能在损失上无脑缩放、又能长出任务无关的能力那一刻。核心三要素:统一的 tokenizer、自然的因果顺序、可验证的 scaling law。二、视觉这边发生了什么:BERT 时刻已过,GPT 时刻已到生成侧视觉预训练这些年其实一直在"抄" NLP 的时间线,只是每步都慢一点、变形一点。2.1 掩码时代的"视觉 BERT 时刻"(2021-2022)视觉社区先把 BERT 抄了过来。BEiT(arXiv:2106.08254,ICLR 2022)是标志性工作:先用 VQ 词表把图像变成离散 token,再做 BERT 式的掩码图像建模。它证明了同一设定下 BEiT-Base 微调 ImageNet 达83.2%,超过从头训练的 DeiT(81.8%)。图 1:BEiT 预训练流程——图像先被 tokenizer 离散化成视觉 token,再对 patch 做块级掩码、预测掩掉的 token,结构与 BERT 的 masked language modeling 一一对应(图源:BEiT 论文 arXiv:2106.08254 Figure 1)
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。