AI击穿了“视频图灵测试”,1700万网友在线围观
发布时间:2026/10/4 9:11:48 锦皓数字建站

AI 学会了「察言观色」过去视频通话常被当成确认身份的一道保险。文字可以代写声音可以合成但让对方打开摄像头聊几句、看表情似乎总能多一分把握。如今连这份眼见为实的笃定也开始受到挑战。最近AI 研究团队 Tavus 发布实时视频交互模型 Griffin并公布了一项实验结果。在与其研究预览版 Griffin-Lite 进行一分钟视频通话后54 名参与者中有 26 人认为屏幕另一端坐着一个真人占比约为 48%。▲ 截至发稿前近 1736 万网友围观作为对照Tavus 上一代系统在相同实验流程下只有 41 人中的 1 人被当成真人比例为 2.4%。Tavus 据此宣称Griffin 是首个通过实时「视频图灵测试」的模型并将其归入一个新类别 Human Interaction Model简称 HIM即人类交互模型。不过「首次通过」目前仍是 Tavus 对实验结果的定义同时由于尚未全面开放预览不排除存在画饼 Demo 的嫌疑而要具体理解这次发布需要同时看清三个问题参与者如何被说服模型如何完成互动以及一分钟的表现究竟能证明多少。让人相信的细节藏在说话之外与 AI 聊天时最容易让人出戏的瞬间未必是答案有多离谱有时只是它太不会接话。你停下来组织语言它立刻抢着回答你讲了一件难过的事屏幕上的脸却还挂着笑你打断它它仍沿着原来的节奏继续说。答案可能没有错交流却始终有些别扭。Griffin 尝试处理的就是这些发生在语言之外的细节。按照 Tavus 的介绍它能够同时看、听、说并根据对方的表情、视线、语气和停顿持续决定接下来该做什么。在官方演示中模型展示了随对话改变情绪、语调和动作的能力还参与了模仿指令游戏、魔方互动以及观察用户焊接电路板等场景。Tavus 希望借此说明模型能够结合画面和时间信息参与交流。比如同样是一段沉默有人正在思考有人已经说完有人则可能希望对方继续解释。系统需要结合上下文与非语言信号判断避免把每次声音停止都当成发言结束。视觉生成的范围也扩大了。Tavus 称Griffin 能从一张参考图像出发实时生成整个画面包括人物的脸、手臂、手指以及椅子的移动、阴影和背景变化。因此屏幕上的角色在听人说话时也可以点头、调整视线或改变表情不必等到自己的台词开始才突然有了动作。AI 想学会聊天得摆脱轮流答题的节奏上述能力背后是交互方式的变化。常见的级联系统会依次完成语音识别、语言模型回答、语音合成和数字人驱动多个环节前后衔接。用户说完一句系统处理一句再把结果交给下一环节。Griffin 采用全双工视频交互方案。所谓全双工就是系统在输出语音和视频的同时仍持续接收并处理用户的声音与画面。▲ 左为原图右由 AI 辅助翻译仅供参考它由两个主要部分构成。持续对话建模引擎负责感知现场、决定说什么以及何时回应同时输出情绪、表情和动作等控制信号音视频生成引擎则将这些信号转化为连续的声音与画面。对话引擎以小于一秒的间隔重新评估交流状态所以模型在一句话说到一半时也能根据用户反应决定暂停、继续或让出发言机会。实现这种配合还需要生成速度跟得上。Griffin-Lite 的语音模块采用流式生成能够随着控制信号到来逐步输出声音并支持利用约 10 秒参考音频克隆声音。视频模块则以每段 320 毫秒的方式实时生成 720p、25 帧每秒的视频。团队通过模型蒸馏和自回归训练将原本多步生成的过程压缩为少步生成同时改善长时间输出时的画面稳定性。在 Tavus 公布的 H100 测试中音频到达后其效果出现在画面上的平均延迟为 0.43 秒约为比较对象中下一快方法的一半。该数字衡量的是音频到视频的生成延迟不能直接当成用户提问到收到完整回答的时间。‘画面质量方面Griffin-Lite 在与四种已发表流式扩散模型的比较中取得了 DOVER、FID 和 THEval 三项指标的最佳成绩唇形同步指标 LSE-C 得分为 7.27位列第二。榜单接近人类一分钟实验仍有边界除了内部测试Griffin-Lite 也出现在英伟达的 VideoFDB 公开榜单上。该基准分别评估模型能否理解交流中的非语言信号以及能否生成符合情境的声音、表情和动作。生成赛道中Griffin-Lite 的总分为 3.83人类参考分为 3.92排名下一位的 Gemini 2.5 与 Anam 组合为 2.80。感知赛道中Griffin-Lite 得分 3.73人类参考分为 4.20最高的其他公开基线成绩为 3.44。两项成绩均领先榜单中的其他 AI 系统但它们属于特定基准下的评分。尤其需要注意部分比较对象只接收音频部分接收音视频输入条件存在差异排名不能直接推广为所有能力的比较结论。至于最受关注的 48%来自另一项由 Tavus 组织、通过独立研究平台招募参与者的实验。参与者事先被告知将与另一名参与者视频通话一分钟讨论今年最期待的事情。实际出现在屏幕上的是由 Griffin-Lite 实时生成脸、声音和回应的 AI 角色。通话结束后参与者先评价对方的自然程度、可信度和交流体验直到问卷最后才被问及是否怀疑过对方并非真人。研究结束时所有人都被告知了 AI 身份。最终26 人判断对方是真人这组参与者对判断的平均信心为 79%认为对方是 AI 的参与者平均信心则为 81%。产生怀疑的人通常在通话开始后的 20 秒内就有所察觉。模型也尚未消除所有交流障碍。在七分制评价中自然程度为 5.4可信度为 5.6再次交流意愿为 5.8而对话流畅程度为 4.9是五项评价中最低的一项。实验说明实时合成的面孔已经能够在特定条件下让部分人信以为真。但样本只有 54 人通话仅持续一分钟参与者又被提前告知对方是另一个人结果仍需要更大规模、更长时间和更多场景的验证。越像真人越需要说明自己是谁在 Tavus 对 Griffin 的愿景中你永远不会去思考交流的「机制」。你不会去想「我要用什么词汇才能让他听懂」你只是自然地表达让对话如水般流淌。想象一下未来的在线辅导不再是冷冰冰的 PPT 录播。AI 老师能从你紧锁的眉头看出你没听懂然后主动换一种更通俗的比喻未来的客服不需要你费尽心机描述零件的型号你只需要把它举到摄像头前AI 就能和你一起研究怎么修理它。机器终于俯下身来走进了人类的语境里。这也是为什么Tavus 在发布 Griffin-Lite 预览版的同时宣布只向部分可信测试者开放研究预览尚未供普通客户使用。团队表示正在开发 AI 身份披露功能并开展进一步的安全与对齐评估更广泛的发布将取决于相关问题的处理进展。过去数字人的挑战是怎样让人愿意与它交流随着实时生成越来越自然产品还必须回答怎样让人知道自己正在与谁交流。让 AI 学会看眼色可能会降低使用门槛让用户看清它的身份则将决定这份便利能否建立在信任之上。原文链接刚刚AI击穿了“视频图灵测试”1700万网友在线围观-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。