Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Weijie, Xiong, Xuantang, Hu, Zhenlin, Zhu, Xiaomeng, Zhao, Chaoyang, Dong, Honghui, Zhang, Zhengyou, Tang, Ming, Wang, Jinqiao |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
por: Zhou, Weijie, et al.
Publicado: (2025)
por: Zhou, Weijie, et al.
Publicado: (2025)
ProAct: A Benchmark and Multimodal Framework for Structure-Aware Proactive Response
por: Zhu, Xiaomeng, et al.
Publicado: (2026)
por: Zhu, Xiaomeng, et al.
Publicado: (2026)
LightPlanner: Unleashing the Reasoning Capabilities of Lightweight Large Language Models in Task Planning
por: Zhou, Weijie, et al.
Publicado: (2025)
por: Zhou, Weijie, et al.
Publicado: (2025)
ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning
por: Zhou, Weijie, et al.
Publicado: (2025)
por: Zhou, Weijie, et al.
Publicado: (2025)
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability
por: Zhou, Weijie, et al.
Publicado: (2025)
por: Zhou, Weijie, et al.
Publicado: (2025)
FOCUS: Fine-grained Optimization with Semantic Guided Understanding for Pedestrian Attributes Recognition
por: An, Hongyan, et al.
Publicado: (2025)
por: An, Hongyan, et al.
Publicado: (2025)
Listen First, Then Answer: Timestamp-Grounded Speech Reasoning
por: Jeong, Jihoon, et al.
Publicado: (2026)
por: Jeong, Jihoon, et al.
Publicado: (2026)
ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing
por: An, Yongqi, et al.
Publicado: (2026)
por: An, Yongqi, et al.
Publicado: (2026)
EgoEdit: Dataset, Real-Time Streaming Model, and Benchmark for Egocentric Video Editing
por: Li, Runjia, et al.
Publicado: (2025)
por: Li, Runjia, et al.
Publicado: (2025)
In the Eye of MLLM: Benchmarking Egocentric Video Intent Understanding with Gaze-Guided Prompting
por: Peng, Taiying, et al.
Publicado: (2025)
por: Peng, Taiying, et al.
Publicado: (2025)
Efficient Masked Autoencoders with Self-Consistency
por: Li, Zhaowen, et al.
Publicado: (2023)
por: Li, Zhaowen, et al.
Publicado: (2023)
Listen to Look into the Future: Audio-Visual Egocentric Gaze Anticipation
por: Lai, Bolin, et al.
Publicado: (2023)
por: Lai, Bolin, et al.
Publicado: (2023)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
por: Zheng, Shurong, et al.
Publicado: (2026)
por: Zheng, Shurong, et al.
Publicado: (2026)
Listening Across the Cosmic Time: Standard Sirens from Ground- and Space-Based Missions in the Next Decade
por: Salvarese, Alberto, et al.
Publicado: (2025)
por: Salvarese, Alberto, et al.
Publicado: (2025)
CoSLight: Co-optimizing Collaborator Selection and Decision-making to Enhance Traffic Signal Control
por: Ruan, Jingqing, et al.
Publicado: (2024)
por: Ruan, Jingqing, et al.
Publicado: (2024)
Fine-grained Spatiotemporal Grounding on Egocentric Videos
por: Liang, Shuo, et al.
Publicado: (2025)
por: Liang, Shuo, et al.
Publicado: (2025)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
por: Yang, Fan, et al.
Publicado: (2026)
por: Yang, Fan, et al.
Publicado: (2026)
Ego-Grounding for Personalized Question-Answering in Egocentric Videos
por: Xiao, Junbin, et al.
Publicado: (2026)
por: Xiao, Junbin, et al.
Publicado: (2026)
VoiceAssistant-Eval: Benchmarking AI Assistants across Listening, Speaking, and Viewing
por: Wang, Ke, et al.
Publicado: (2025)
por: Wang, Ke, et al.
Publicado: (2025)
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
por: Yu, Shoubin, et al.
Publicado: (2026)
por: Yu, Shoubin, et al.
Publicado: (2026)
Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring
por: Zhan, Yufei, et al.
Publicado: (2024)
por: Zhan, Yufei, et al.
Publicado: (2024)
EgoSound: Benchmarking Sound Understanding in Egocentric Videos
por: Zhu, Bingwen, et al.
Publicado: (2026)
por: Zhu, Bingwen, et al.
Publicado: (2026)
Chapter 3 Autophony: Listening to your Eyes Move
por: Harris, Anna
Publicado: (2019)
por: Harris, Anna
Publicado: (2019)
Can Speech LLMs Think while Listening?
por: Shih, Yi-Jen, et al.
Publicado: (2025)
por: Shih, Yi-Jen, et al.
Publicado: (2025)
Improving Generalization in LLM Structured Pruning via Function-Aware Neuron Grouping
por: Yu, Tao, et al.
Publicado: (2025)
por: Yu, Tao, et al.
Publicado: (2025)
ANNEXE: Unified Analyzing, Answering, and Pixel Grounding for Egocentric Interaction
por: Su, Yuejiao, et al.
Publicado: (2025)
por: Su, Yuejiao, et al.
Publicado: (2025)
A Benchmark for Crime Surveillance Video Analysis with Large Models
por: Chen, Haoran, et al.
Publicado: (2025)
por: Chen, Haoran, et al.
Publicado: (2025)
MME-Industry: A Cross-Industry Multimodal Evaluation Benchmark
por: Yi, Dongyi, et al.
Publicado: (2025)
por: Yi, Dongyi, et al.
Publicado: (2025)
Friend or Foe? Harnessing Controllable Overfitting for Anomaly Detection
por: Qian, Long, et al.
Publicado: (2024)
por: Qian, Long, et al.
Publicado: (2024)
Quality-Aware Language-Conditioned Local Auto-Regressive Anomaly Synthesis and Detection
por: Qian, Long, et al.
Publicado: (2025)
por: Qian, Long, et al.
Publicado: (2025)
MathPhys-Guided Coarse-to-Fine Anomaly Synthesis with SQE-Driven Bi-Level Optimization for Anomaly Detection
por: Qian, Long, et al.
Publicado: (2025)
por: Qian, Long, et al.
Publicado: (2025)
Visual Intention Grounding for Egocentric Assistants
por: Sun, Pengzhan, et al.
Publicado: (2025)
por: Sun, Pengzhan, et al.
Publicado: (2025)
An Industry Study on Thermoplastic Elastomer (TPE) Materials: Innovations and Applications by Dongguan Renergy Plastic Technology Co., Ltd.
por: Hossain, Md Anwar, et al.
Publicado: (2026)
por: Hossain, Md Anwar, et al.
Publicado: (2026)
In the Eye of Transformer: Global-Local Correlation for Egocentric Gaze Estimation
por: Lai, Bolin, et al.
Publicado: (2022)
por: Lai, Bolin, et al.
Publicado: (2022)
Eyes on Target: Gaze-Aware Object Detection in Egocentric Video
por: Lall, Vishakha, et al.
Publicado: (2025)
por: Lall, Vishakha, et al.
Publicado: (2025)
EgoCampus: Egocentric Pedestrian Eye Gaze Model and Dataset
por: John, Ronan, et al.
Publicado: (2025)
por: John, Ronan, et al.
Publicado: (2025)
Highlights of Research Activities in Advanced Materials at Wuhan University
por: Lei Fu, et al.
Publicado: (2024)
por: Lei Fu, et al.
Publicado: (2024)
Grounded by Experience: Generative Healthcare Prediction Augmented with Hierarchical Agentic Retrieval
por: Zhao, Chuang, et al.
Publicado: (2025)
por: Zhao, Chuang, et al.
Publicado: (2025)
FiLo++: Zero-/Few-Shot Anomaly Detection by Fused Fine-Grained Descriptions and Deformable Localization
por: Gu, Zhaopeng, et al.
Publicado: (2025)
por: Gu, Zhaopeng, et al.
Publicado: (2025)
UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly Detection
por: Gu, Zhaopeng, et al.
Publicado: (2024)
por: Gu, Zhaopeng, et al.
Publicado: (2024)
Ejemplares similares
-
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
por: Zhou, Weijie, et al.
Publicado: (2025) -
ProAct: A Benchmark and Multimodal Framework for Structure-Aware Proactive Response
por: Zhu, Xiaomeng, et al.
Publicado: (2026) -
LightPlanner: Unleashing the Reasoning Capabilities of Lightweight Large Language Models in Task Planning
por: Zhou, Weijie, et al.
Publicado: (2025) -
ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning
por: Zhou, Weijie, et al.
Publicado: (2025) -
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability
por: Zhou, Weijie, et al.
Publicado: (2025)