南京大学携手上海AI实验室:AI助手学会“替盲人看路“能做到几分?
2026/7/29 0:37:34 网站建设 项目流程

这项由南京大学与上海人工智能实验室联合开展的研究,发布于2026年7月,论文编号为arXiv:2607.14660v1,发表于计算机视觉领域预印本平台arXiv,任何有兴趣深入了解的读者均可通过该编号查询完整论文。

世界上有数以亿计的视障人士,他们每天面对的挑战,远比我们想象的要多。过一条马路、找到一家店的入口、读懂一块路牌——这些对普通人来说不过是随手而为的小事,对一个看不见的人来说,却可能是需要反复权衡、小心翼翼的难题。传统的辅助工具,比如盲杖和导盲犬,当然有用,但它们能传递的信息非常有限:盲杖能感知脚下有没有台阶,却无法告诉你前方路牌上写的是什么;导盲犬能带你绕开障碍,却无法帮你判断眼前的红绿灯是不是绿了。

近年来,随着多模态大语言模型(简单理解就是那种既能"看图"又能"说话"的AI,比如大家熟悉的GPT-4o、Gemini这类产品)的快速发展,研究者们开始设想:能不能让AI充当一双"眼睛",实时陪伴在视障人士身边,随时告诉他们周围发生了什么?这个想法听起来很美好,但问题在于——现有的AI究竟有没有这种能力?它们真的能胜任这份工作吗?

为了回答这个问题,研究团队做了一件非常扎实的事:他们从零开始,专门搭建了一套叫做**VIABench**的测试平台,用来严格考察各种AI模型在真实视障辅助场景下的表现。这套平台的核心材料,来自视障人士本人在日常生活中拍摄或分享的第一视角视频——也就是说,镜头里呈现的,是视障人士真实看到(或者说,真实摄录到)的世界:歪斜的画面、被手指遮住的镜头、光线异常的街道……这些都是真实存在的挑战,而不是经过精心布置的实验室场景。

研究结果说出来有些扎心:即便是当下最强大的AI模型,面对这些真实场景时,表现仍然相当有限。最强的模型GPT-5,综合得分也只有28.8分(满分为100分),距离真正实用还有相当大的距离。这不是在否定AI的价值,而是在诚实地告诉我们:为视障人士服务,是一件比我们想象中更难的事。

---

一、为什么现有的测试平台不够用

在这项研究出现之前,学界已经有一些针对视障辅助的数据集和测试工具,但它们各自都有明显的局限性。

以"WAD数据集"为例,它的视频素材来自YouTube上的旅行视频博主——这些视频是拍给明眼人看的,画面清晰、构图考究、内容经过剪辑。把这样的素材用来测试视障辅助AI,就好比用高档餐厅的菜单来测试一个社区食堂厨师的水平,两者的使用场景完全不同。

另一个叫"EgoBlind"的数据集虽然确实收集了视障人士自己拍摄的视频,但它的任务设计比较被动:用户提问,AI回答,仅此而已。然而在真实生活中,视障人士需要的不仅仅是"被动回答",更重要的是AI能主动发现危险、主动提醒——就像一个随时保持警觉的向导,而不是一个只有被点名才开口的助理。

正因为现有工具存在这些缺口,研究团队决定重新设计一套更贴近真实需求的测试框架,这就是VIABench的由来。

---

二、VIABench是什么,它考察的是哪三种能力

VIABench的核心思路,是把视障人士在日常生活中需要AI帮助的场景,归纳成三种最典型的模式,分别对应AI需要具备的三种不同能力。

第一种叫"主动提醒"。这种场景对应的是用户在街上走路,什么都没有说,但AI需要全程盯着画面,一旦发现危险或重要信息,就要主动开口。比如,前方2米处有一根电线杆、脚下地面有个坑洼、正在穿越的斑马线快到头了……这些都需要AI在用户开口之前就说出来。这和我们熟悉的"问一句答一句"的AI截然不同——它要求AI不仅能"看懂"画面,还要能判断"现在是不是该说话的时机"。

第二种叫"视觉问答"。这种场景比较直观:用户边走边问,比如"前面的交通灯现在是什么颜色?""右边那个建筑是什么?"AI需要根据当前及过去的画面内容,给出准确的实时回答。关键在于,AI只能用"问题发生时刻之前"的视频内容来回答,不能"偷看"未来的画面——因为真实生活中,时间是单向流动的,AI不可能提前知道用户还没走到的地方是什么样子。

第三种叫"视觉引导交互"。这是三种任务中最复杂的一种。用户有一个具体的目标,比如"帮我找到电梯里的5楼按钮"。AI需要一步一步地给出指令,比如"把手机镜头稍微往右移一点""现在稍微往上抬""对,就是那个按钮,第三排左边第二个"——直到用户真正完成了这个操作。这不是一问一答,而是一个持续的、来来回回的对话过程,AI需要根据每一帧新画面不断调整自己的指引。

这三种任务加在一起,基本覆盖了视障人士在外出时可能遇到的绝大多数需求:走路时的被动保护、遇到疑问时的主动询问、需要完成某件事时的手把手引导。

---

三、VIABench里装的是什么样的数据

VIABench的数据来源经过了精心设计,研究团队从两个渠道收集了视频素材。

一部分是真实视障人士创作者在YouTube、哔哩哔哩、抖音等平台上发布的日常视频。研究团队通过关键词搜索和人工筛选,挑选出那些真实呈现日常生活场景、画质和内容符合要求的片段。这些视频共有530段,合计约44小时,这就是数据集的主体。

另一部分是"模拟视频",共231段。这些视频是由经过专门训练的标注人员拍摄的——他们在完成了大量真实视频的标注工作之后,对视障人士的行为模式、摄像习惯和互动方式有了深入了解,然后模拟重现了"视觉引导交互"类场景。这类场景在公开视频中极少出现,所以需要专门补充。

整个数据集最终包含761段视频、超过14526条人工标注,总时长约47小时,单段视频平均长度222秒,最长的视频将近33分钟。相比之下,此前同类数据集EgoBlind的视频平均只有40秒,WalkVLM的视频更是只有3秒。这种"长视频"的设计是有意为之的——因为现实生活中的导航场景往往持续很长时间,AI需要在整个过程中保持注意力,而不是只处理一个孤立的片段。

在标注质量上,研究团队投入了大量精力。14名学生标注员先在150段视频上进行试标注,发现问题、修正规则;之后再与专业标注公司合作,完成大规模标注;最后由团队内部专家进行多轮审核,并将所有中文标注通过GPT-4o翻译成英文,确保国际可用性。标注员被要求严格遵守两个原则:只能根据视觉信息做判断(不能听声音、看字幕),以及只能根据"当前及之前"的画面做判断(不能往后翻视频)。

数据集还特别强调了一种现实挑战:视障人士自己拍摄的视频,画质往往很差——镜头可能被手指遮住、曝光可能严重过度、画面可能大幅度旋转倾斜。VIABench明确把"当AI遇到这种低质量画面时,能不能识别出来并及时提醒用户调整摄像头"列为考核项目之一,因为在真实场景中,这种能力关乎用户的人身安全。

---

四、主动提醒任务下面藏着21个更细的考题

"主动提醒"是VIABench三大任务中最核心、也最困难的一个,研究团队在它下面细分出了21个具体的子任务,每一个都对应了视障人士在户外行走时可能遭遇的特定情境。

这21个子任务大致可以分为几个方向。关于障碍物的,包括"障碍物提醒"(身边2米内有人、车、柱子等)和"主动躲避"(前方路被堵死了,必须绕行)。关于路面状况的,有"台阶上下"(1到3级的小台阶)、"楼梯上下"(完整的一段楼梯)、"坡道上下"、"路面状况"(坑洼、积水等)。关于方向导航的,有"方向偏移"(用户走歪了)、"方向引导"(前方路断了,需要转弯)、"路口识别"、"岔路口"。关于过马路的,有"斑马线"(是否在斑马线范围内)、"过马路到对面"、"行人信号灯"。关于特定设施的,有"盲道识别"、"人行道检测"、"自动扶梯"、"出入口识别"、"服务设施检测"(椅子、垃圾桶等)、"标志牌识别"。关于摄像头本身问题的,有"摄像头遮挡"和"摄像头内容异常"(画面全黑、过曝等)。

这些子任务的设计有一个细节值得关注:其中有几类任务被标记为"立即触发",意思是一旦发生就必须马上提醒,不能等待——比如"斑马线偏移"(用户在过马路时走出了斑马线范围)、"方向偏移"(用户走歪了)、"摄像头遮挡"、"摄像头内容异常"。这类情况如果拖延提醒,可能直接造成危险。

对于其他大多数任务,提醒的时机则需要更精细地判断。研究团队定义了一个"安全提醒范围":正前方大约1.5到2米(相当于走4到6步),以及两侧各约50厘米(大约一个人宽)。只有当障碍物进入这个范围,且确实可能影响用户行走时,才需要触发提醒。太早提醒可能造成困惑(远处的行人还没到危险距离,不需要管),太晚提醒则可能已经来不及反应。

---

五、TPAD:让"只会回答问题"的AI学会"主动开口"

这里面有一个技术上的难题需要解释一下。目前市面上大多数AI模型,包括GPT-4o、InternVL这类,都是"被动式"的——你给它一段视频或一张图,问它问题,它才回答。它们并不具备"主动监视视频流、自己决定什么时候开口"的能力。

但主动提醒任务恰恰需要的就是这种"主动开口"的能力。那么,怎么让这些"只会被动回答"的AI参与到主动提醒的测试中来?

研究团队为此专门设计了一套叫做**TPAD**(Token级提示激活解码)的机制。用一个类比来理解:普通的AI回答问题,就像你拿着一份试卷去问老师,老师逐题回答;而TPAD做的事,是让老师把整份试卷扫一眼,然后在每道题旁边悄悄打上一个"这道题值得提醒"或"这道题不用管"的标记,最后统一输出结论。

具体来说,TPAD把整段视频的所有帧和一个固定的提示语(大意是"用户现在需要被提醒吗?选A是需要,选B是不需要")一起输入给AI模型,让模型一次性处理完整个视频序列。然后,对于每一帧画面,TPAD从模型的内部状态中提取出一个概率值:这一帧,AI有多大把握认为"现在应该提醒用户"?如果概率超过阈值,就触发提醒。

这个设计有两个好处:效率高,因为只需要做一次完整推理,而不是每隔一秒就单独问一次AI(后者的计算量会随视频长度线性增长);同时,由于整段视频被一起输入,AI在判断某一帧是否需要提醒时,能同时参考之前所有帧的上下文,而不是只看孤立的单帧——这对于一些需要前后对比才能判断的情况(比如"用户走歪了多少")尤为重要。

研究团队做了一个具体的对比实验:在一段53秒的视频上,传统的逐帧提问方式需要344秒才能完成处理,而TPAD只需要76秒,速度提升了4.5倍,而且识别准确率完全相同。

---

六、测试了哪些AI,结果怎么样

研究团队对三大类AI模型进行了全面测试。

第一类是开源的离线模型,也就是可以自由下载、在本地运行的AI,包括InternVL3.5系列(1B、4B、8B三个规模)、Qwen2.5VL系列(3B、7B两个规模)、LLaVA-Video-7B、LLaVA-OneVision-1.5-8B、Kimi-VL-A3B、MiniCPM-V 4.5和MiniCPM-o 2.6。这类模型参与主动提醒测试时,都通过TPAD机制进行适配。

第二类是闭源的商业模型,包括OpenAI的GPT-5和GPT-4o,以及Google的Gemini-2.5 Pro。由于这类模型的内部结构不对外开放,无法使用TPAD,所以它们参与主动提醒测试时,采用的是传统的逐帧提问方式。

第三类是专门为实时视频流设计的在线流式模型,包括LiveCC、VideoLLM-Online和StreamingVLM。这类模型天生就具备"主动输出"的能力,所以直接用它们自己的运行方式参与测试。

综合测试结果来看,GPT-5以28.8分排名第一,Gemini-2.5 Pro以27.1分紧随其后,GPT-4o得到25.2分。开源模型中表现最好的是InternVL3.5-8B,综合得分19.1分。

在主动提醒这个最核心的任务上,情况更加严峻。在"第一阶段"(即AI能不能在正确的时间窗口内检测到需要提醒的事件)这个环节,所有离线开源模型的召回率都低于45%,意味着有超过一半需要提醒的时刻被漏掉了。LLaVA-OneVision-1.5-8B的召回率相对最高,但它在"第二阶段"(检测到了之后,能不能说出准确的提醒语)的质量又相对较差,两个阶段都做好才能真正帮到用户。

那些专门为实时流设计的在线模型,召回率看起来很高,LiveCC甚至达到了75.8%。但这个数字有些"虚高"——这类模型的实际表现是像水龙头一样持续不断地输出内容,不管画面里有没有需要提醒的东西,它都在说话。高召回率的背后,是大量的误报和与任务完全无关的描述,根本称不上真正的"主动提醒",只能算是"持续念旁白"。

在视觉问答和视觉引导交互这两个任务上,AI的表现相对好一些,但仍然存在明显问题。特别是在交互任务中,开源模型经常犯一个根本性的错误:它们会像对待明眼人一样给出指令,比如"看看左边"或者"显示屏上能看到时间"——完全忘记了用户是看不见的,这类回答对视障人士毫无用处,甚至会造成混淆。闭源的GPT-5和Gemini-2.5 Pro在这方面表现明显更好,它们能意识到用户的视障身份,给出更贴合实际的指引,比如"把手机镜头往右移大概两个手掌宽的距离"。

---

七、多给AI看几帧有用吗?为什么视障辅助和普通视频理解不一样

这里有一个很有趣的发现值得专门说一说。在很多视频理解任务中,给AI看的帧数越多,它表现越好——毕竟信息越多越好理解嘛。但在VIABench上,研究团队测试了从8帧到128帧的不同输入设置,结果发现:帧数的增加几乎没有带来明显的性能提升。

为什么会这样?原因在于视障辅助场景的本质特点。导航时,环境是实时变化的,几分钟前的画面(比如那时候人行道上没有人)对现在的判断参考价值很低;而当前这一刻,AI需要快速、准确地告诉用户"此刻"周围发生了什么。这和看一部电影需要理解前因后果完全不同——视障辅助更像是实时翻译,需要的是对"当下"的精准感知,而不是对"历史"的深度理解。

此外,研究团队还测量了各个模型的实际推理速度。在单张英伟达L20 GPU上,当输入32帧时,Qwen2.5-VL-7B需要约4.6秒,InternVL3.5-8B需要约15.5秒。要知道,一个盲人在街上行走,危险可能在一两秒内出现——这样的响应速度,离"实时"还差得很远,更不用说"随时陪伴、实时提醒"的愿景了。

---

八、AI还会"幻觉",而且这对视障人士尤其危险

"幻觉"在AI领域指的是模型说出了与实际画面不符的内容。在普通的聊天场景里,AI说错了可能只是个笑话,但在视障辅助场景里,一个错误的信息可能直接造成危险。

研究团队记录了一个典型案例:一名视障用户在爬楼梯,同时问AI"为什么这个自动扶梯不动,是停电了吗?"——画面里明明是普通楼梯,根本没有扶梯。GPT-5和Gemini-2.5 Pro的表现是正确的:它们告诉用户"你现在走的是固定楼梯,旁边才是扶梯,请向右走一步就能摸到扶梯扶手"。但开源模型InternVL3.5-8B和Qwen2.5-VL-7B则回答"扶梯可能正在维修或故障中"——完全跟着用户的错误假设走,给出了一个严重误导性的答案。

这类幻觉问题,在闭源商业模型中出现的频率明显低于开源模型。研究团队推测,商业模型在训练时更注重让模型"拒绝"不符合画面实际情况的问题,而不是一味顺着用户的问法走。

---

说到底,VIABench这项工作最核心的价值,不在于给出了一套"谁最强"的排名,而在于它诚实地勾画出了当前AI与"真正实用的视障助手"之间的距离。即便是最强的商业AI,综合得分也只有28.8分,意味着在100次需要帮助的时刻里,它大概只能真正帮上30次左右,而且未必每次都帮得准确。

研究团队也坦诚地指出了VIABench本身的局限:视觉引导交互部分的视频是由明眼人模拟拍摄的,和真实视障用户的行为之间仍然存在差距;现实生活中的辅助需求是开放式的,VIABench所覆盖的21个子任务再细致,也不可能穷尽所有情境。

这项研究指向了三个值得追求的方向:一是如何改进AI架构,让它真正具备"主动感知、主动开口"的能力;二是如何构建更丰富的训练数据,让AI接触到真实视障辅助场景中的复杂指令和多样情境;三是如何让AI真正"记住"用户是视障人士,从而在每一次回答中都给出真正对看不见的人有用的信息。

归根结底,视障辅助AI不是一个"视频理解"问题,而是一个"理解人"的问题。只有当AI真正理解了一个看不见的人在行走时需要什么、怕什么、怎么才能帮到他,这项技术才能从实验室里的测试分数,变成真实生活里那双看不见却无处不在的眼睛。有兴趣深入了解这项研究细节的读者,可以通过arXiv论文编号2607.14660查阅完整内容。

---

Q&A

Q1:VIABench测试平台和普通AI视频测试有什么区别?

A:VIABench专门针对视障人士的真实使用场景设计,视频素材来自视障人士本人拍摄,画质差、角度歪、镜头遮挡是常态。它还设置了"主动提醒"任务,要求AI在没有人提问的情况下自己判断何时该开口,这与普通视频问答测试要求用户主动提问有本质区别。

Q2:TPAD机制是怎么让不支持实时视频的AI参与主动提醒测试的?

A:TPAD把整段视频所有帧和一个固定提示语一起输入给AI,然后从模型处理每一帧后的内部状态中提取一个概率值,判断"此刻是否应该提醒用户"。整个过程只需一次推理,速度比逐帧提问快4.5倍,同时因为所有帧同时输入,AI能参考上下文做出更准确的判断。

Q3:为什么专门为实时视频设计的在线流式AI在VIABench上反而表现不好?

A:这类模型会像持续播放旁白一样不断输出内容,不管画面里有没有真正需要提醒的事情。虽然这带来了较高的"检测到事件"的比例,但大量输出与视障导航任务完全无关,模型实际上并没有真正理解"什么时候该说、该说什么",只是在不停地描述眼前的场景,对视障用户帮助极为有限。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询