跳到正文
电商热点雷达

运营热点解读

复旦发布以人为中心的复杂场景音视频追踪基准 | ICML 2026

来源:AITNT AI日报 · 发布时间:

雷达摘要

复旦发布以人为中心的复杂场景音视频追踪基准 | ICML 2026 想象一下这个场景:一场多人线上会议,有人说话时画面自动聚焦到发言者;一段综艺素材,后期系统能自动识别谁在讲话并生成字幕;一段监控录像,系统能在人群中持续追踪正在说话的那个人。 这些功能背后依赖的是同一项技术——音视频说话人追踪(Audio-Visual Speaker Tracking)。它让机器同时利用听到的声音和看到的画面,定位并持续追踪正在发声的人。 过去几年,音视频分割(Audio-Visual Segmentation, AVS)音视频实例分割(Audio-Visual Instance Segmentation, AVIS)任务受到广泛关注,并取得了显著进展。尽管如此,一个基础问题仍未被充分回答:当场景真正变得动态、拥挤且不连续时…

为什么值得关注

视频生成能力变化,影响短视频带货和直播切片的内容产出效率。

建议动作

测试新能力是否能替代现有图片/视频制作流程,评估成本节省空间。

分类:ecommerce

原始信息

本页是基于公开来源生成的摘要与运营提示,不替代原文。请以原始发布方内容为准。

阅读 AITNT AI日报 原文 →