Fine-grained Spatiotemporal Grounding on Egocentric Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liang, Shuo, Zhong, Yiwu, Hu, Zi-Yuan, Tao, Yeyao, Wang, Liwei |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Rethinking Chain-of-Thought Reasoning for Videos
par: Zhong, Yiwu, et autres
Publié: (2025)
par: Zhong, Yiwu, et autres
Publié: (2025)
Enhancing Temporal Modeling of Video LLMs via Time Gating
par: Hu, Zi-Yuan, et autres
Publié: (2024)
par: Hu, Zi-Yuan, et autres
Publié: (2024)
NeMo: Needle in a Montage for Video-Language Understanding
par: Hu, Zi-Yuan, et autres
Publié: (2025)
par: Hu, Zi-Yuan, et autres
Publié: (2025)
Beyond Embeddings: The Promise of Visual Table in Visual Reasoning
par: Zhong, Yiwu, et autres
Publié: (2024)
par: Zhong, Yiwu, et autres
Publié: (2024)
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
par: Zhong, Yiwu, et autres
Publié: (2024)
par: Zhong, Yiwu, et autres
Publié: (2024)
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
par: Dou, Zi-Yi, et autres
Publié: (2024)
par: Dou, Zi-Yi, et autres
Publié: (2024)
EVQAScore: A Fine-grained Metric for Video Question Answering Data Quality Evaluation
par: Liang, Hao, et autres
Publié: (2024)
par: Liang, Hao, et autres
Publié: (2024)
TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models
par: Cai, Mu, et autres
Publié: (2024)
par: Cai, Mu, et autres
Publié: (2024)
Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos
par: Yu, Shoubin, et autres
Publié: (2026)
par: Yu, Shoubin, et autres
Publié: (2026)
Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding
par: Zheng, Duo, et autres
Publié: (2024)
par: Zheng, Duo, et autres
Publié: (2024)
RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback
par: Yu, Tianyu, et autres
Publié: (2023)
par: Yu, Tianyu, et autres
Publié: (2023)
Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA
par: Liang, Jianxin, et autres
Publié: (2025)
par: Liang, Jianxin, et autres
Publié: (2025)
Exo2EgoDVC: Dense Video Captioning of Egocentric Procedural Activities Using Web Instructional Videos
par: Ohkawa, Takehiko, et autres
Publié: (2023)
par: Ohkawa, Takehiko, et autres
Publié: (2023)
UniFine: A Unified and Fine-grained Approach for Zero-shot Vision-Language Understanding
par: Wang, Zhecan, et autres
Publié: (2023)
par: Wang, Zhecan, et autres
Publié: (2023)
Generalist Scanner Meets Specialist Locator: A Synergistic Coarse-to-Fine Framework for Robust GUI Grounding
par: Li, Zhecheng, et autres
Publié: (2025)
par: Li, Zhecheng, et autres
Publié: (2025)
HawkEye: Training Video-Text LLMs for Grounding Text in Videos
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
Grounded Question-Answering in Long Egocentric Videos
par: Di, Shangzhe, et autres
Publié: (2023)
par: Di, Shangzhe, et autres
Publié: (2023)
Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding
par: Nagrani, Arsha, et autres
Publié: (2026)
par: Nagrani, Arsha, et autres
Publié: (2026)
Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting
par: Tang, Yunlong, et autres
Publié: (2025)
par: Tang, Yunlong, et autres
Publié: (2025)
Taming CLIP for Fine-grained and Structured Visual Understanding of Museum Exhibits
par: Balauca, Ada-Astrid, et autres
Publié: (2024)
par: Balauca, Ada-Astrid, et autres
Publié: (2024)
Towards Generative Class Prompt Learning for Fine-grained Visual Recognition
par: Chattopadhyay, Soumitri, et autres
Publié: (2024)
par: Chattopadhyay, Soumitri, et autres
Publié: (2024)
Learning 6-DoF Fine-grained Grasp Detection Based on Part Affordance Grounding
par: Song, Yaoxian, et autres
Publié: (2023)
par: Song, Yaoxian, et autres
Publié: (2023)
FINEMATCH: Aspect-based Fine-grained Image and Text Mismatch Detection and Correction
par: Hua, Hang, et autres
Publié: (2024)
par: Hua, Hang, et autres
Publié: (2024)
MVAM: Multi-View Attention Method for Fine-grained Image-Text Matching
par: Cui, Wanqing, et autres
Publié: (2024)
par: Cui, Wanqing, et autres
Publié: (2024)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
par: Jing, Liqiang, et autres
Publié: (2024)
par: Jing, Liqiang, et autres
Publié: (2024)
DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation
par: Hu, Jie, et autres
Publié: (2026)
par: Hu, Jie, et autres
Publié: (2026)
Video-guided Machine Translation with Global Video Context
par: Chen, Jian, et autres
Publié: (2026)
par: Chen, Jian, et autres
Publié: (2026)
Grounded Multi-Hop VideoQA in Long-Form Egocentric Videos
par: Chen, Qirui, et autres
Publié: (2024)
par: Chen, Qirui, et autres
Publié: (2024)
Light Up the Shadows: Enhance Long-Tailed Entity Grounding with Concept-Guided Vision-Language Models
par: Zhang, Yikai, et autres
Publié: (2024)
par: Zhang, Yikai, et autres
Publié: (2024)
Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models
par: Wang, Haibo, et autres
Publié: (2024)
par: Wang, Haibo, et autres
Publié: (2024)
Improving Brain-to-Image Reconstruction via Fine-Grained Text Bridging
par: Xia, Runze, et autres
Publié: (2025)
par: Xia, Runze, et autres
Publié: (2025)
VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI
par: Cheng, Sijie, et autres
Publié: (2024)
par: Cheng, Sijie, et autres
Publié: (2024)
ChartHal: A Fine-grained Framework Evaluating Hallucination of Large Vision Language Models in Chart Understanding
par: Wang, Xingqi, et autres
Publié: (2025)
par: Wang, Xingqi, et autres
Publié: (2025)
EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models
par: Xing, Shangyu, et autres
Publié: (2024)
par: Xing, Shangyu, et autres
Publié: (2024)
Towards Learning a Generalist Model for Embodied Navigation
par: Zheng, Duo, et autres
Publié: (2023)
par: Zheng, Duo, et autres
Publié: (2023)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
par: Li, Zhaowei, et autres
Publié: (2024)
par: Li, Zhaowei, et autres
Publié: (2024)
AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
par: Suglia, Alessandro, et autres
Publié: (2024)
par: Suglia, Alessandro, et autres
Publié: (2024)
EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding
par: Wang, Ziyang, et autres
Publié: (2026)
par: Wang, Ziyang, et autres
Publié: (2026)
MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding
par: Luo, Fuwen, et autres
Publié: (2025)
par: Luo, Fuwen, et autres
Publié: (2025)
Cross-modal Causal Relation Alignment for Video Question Grounding
par: Chen, Weixing, et autres
Publié: (2025)
par: Chen, Weixing, et autres
Publié: (2025)
Documents similaires
-
Rethinking Chain-of-Thought Reasoning for Videos
par: Zhong, Yiwu, et autres
Publié: (2025) -
Enhancing Temporal Modeling of Video LLMs via Time Gating
par: Hu, Zi-Yuan, et autres
Publié: (2024) -
NeMo: Needle in a Montage for Video-Language Understanding
par: Hu, Zi-Yuan, et autres
Publié: (2025) -
Beyond Embeddings: The Promise of Visual Table in Visual Reasoning
par: Zhong, Yiwu, et autres
Publié: (2024) -
AIM: Adaptive Inference of Multi-Modal LLMs via Token Merging and Pruning
par: Zhong, Yiwu, et autres
Publié: (2024)