运营热点解读
复旦发布以人为中心的复杂场景音视频追踪基准 | ICML 2026
雷达摘要
复旦发布以人为中心的复杂场景音视频追踪基准 | ICML 2026 想象一下这个场景:一场多人线上会议,有人说话时画面自动聚焦到发言者;一段综艺素材,后期系统能自动识别谁在讲话并生成字幕;一段监控录像,系统能在人群中持续追踪正在说话的那个人。 这些功能背后依赖的是同一项技术——音视频说话人追踪(Audio-Visual Speaker Tracking)。它让机器同时利用听到的声音和看到的画面,定位并持续追踪正在发声的人。 过去几年,音视频分割(Audio-Visual Segmentation, AVS)音视频实例分割(Audio-Visual Instance Segmentation, AVIS)任务受到广泛关注,并取得了显著进展。尽管如此,一个基础问题仍未被充分回答:当场景真正变得动态、拥挤且不连续时…
为什么值得关注
视频生成能力变化,影响短视频带货和直播切片的内容产出效率。
建议动作
测试新能力是否能替代现有图片/视频制作流程,评估成本节省空间。
分类:ecommerce
原始信息
本页是基于公开来源生成的摘要与运营提示,不替代原文。请以原始发布方内容为准。
电商热点雷达