Dr.V: A Hierarchical Perception-Temporal-Cognition Framework to Diagnose Video Hallucination by Fine-grained Spatial-Temporal Grounding
Fuente:
arXiv
Saved in:
| Main Authors: | Luo, Meng, Wu, Shengqiong, Jing, Liqiang, Ju, Tianjie, Zheng, Li, Lai, Jinxiang, Wu, Tianlong, Du, Xinya, Li, Jian, Yan, Siyuan, Luo, Jiebo, Wang, William Yang, Fei, Hao, Lee, Mong-Li, Hsu, Wynne |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Evidence-Based Temporal Fact Verification
by: Barik, Anab Maulana, et al.
Published: (2024)
by: Barik, Anab Maulana, et al.
Published: (2024)
ChronoFact: Timeline-based Temporal Fact Verification
by: Barik, Anab Maulana, et al.
Published: (2024)
by: Barik, Anab Maulana, et al.
Published: (2024)
Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
by: Fei, Hao, et al.
Published: (2024)
by: Fei, Hao, et al.
Published: (2024)
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
by: Huang, Haojian, et al.
Published: (2025)
by: Huang, Haojian, et al.
Published: (2025)
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
by: Liu, Kai, et al.
Published: (2025)
by: Liu, Kai, et al.
Published: (2025)
Orthogonal Spatial-temporal Distributional Transfer for 4D Generation
by: Liu, Wei, et al.
Published: (2026)
by: Liu, Wei, et al.
Published: (2026)
PanoSent: A Panoptic Sextuple Extraction Benchmark for Multimodal Conversational Aspect-based Sentiment Analysis
by: Luo, Meng, et al.
Published: (2024)
by: Luo, Meng, et al.
Published: (2024)
FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models
by: Jing, Liqiang, et al.
Published: (2023)
by: Jing, Liqiang, et al.
Published: (2023)
FG-PRM: Fine-grained Hallucination Detection and Mitigation in Language Model Mathematical Reasoning
by: Li, Ruosen, et al.
Published: (2024)
by: Li, Ruosen, et al.
Published: (2024)
On the Adaptive Psychological Persuasion of Large Language Models
by: Ju, Tianjie, et al.
Published: (2025)
by: Ju, Tianjie, et al.
Published: (2025)
Multi-Part Object Representations via Graph Structures and Co-Part Discovery
by: Foo, Alex, et al.
Published: (2025)
by: Foo, Alex, et al.
Published: (2025)
Multi-Modal Continual Learning via Cross-Modality Adapters and Representation Alignment with Knowledge Preservation
by: Chee, Evelyn, et al.
Published: (2025)
by: Chee, Evelyn, et al.
Published: (2025)
From Personas to Talks: Revisiting the Impact of Personas on LLM-Synthesized Emotional Support Conversations
by: Wu, Shenghan, et al.
Published: (2025)
by: Wu, Shenghan, et al.
Published: (2025)
LEAF-Mamba: Local Emphatic and Adaptive Fusion State Space Model for RGB-D Salient Object Detection
by: Wu, Lanhu, et al.
Published: (2025)
by: Wu, Lanhu, et al.
Published: (2025)
FGAIF: Aligning Large Vision-Language Models with Fine-grained AI Feedback
by: Jing, Liqiang, et al.
Published: (2024)
by: Jing, Liqiang, et al.
Published: (2024)
LogicReward: Incentivizing LLM Reasoning via Step-Wise Logical Supervision
by: Xu, Jundong, et al.
Published: (2025)
by: Xu, Jundong, et al.
Published: (2025)
Mitigating GenAI-powered Evidence Pollution for Out-of-Context Multimodal Misinformation Detection
by: Yan, Zehong, et al.
Published: (2025)
by: Yan, Zehong, et al.
Published: (2025)
SNIFFER: Multimodal Large Language Model for Explainable Out-of-Context Misinformation Detection
by: Qi, Peng, et al.
Published: (2024)
by: Qi, Peng, et al.
Published: (2024)
TRUST-VL: An Explainable News Assistant for General Multimodal Misinformation Detection
by: Yan, Zehong, et al.
Published: (2025)
by: Yan, Zehong, et al.
Published: (2025)
Test-Time Adaptation by Causal Trimming
by: Liu, Yingnan, et al.
Published: (2025)
by: Liu, Yingnan, et al.
Published: (2025)
Dynamic Routing in Space-Ground Integrated Quantum Networks
by: Hu, Tianjie, et al.
Published: (2025)
by: Hu, Tianjie, et al.
Published: (2025)
When Disagreements Elicit Robustness: Investigating Self-Repair Capabilities under LLM Multi-Agent Disagreements
by: Ju, Tianjie, et al.
Published: (2025)
by: Ju, Tianjie, et al.
Published: (2025)
Watch Out Your Album! On the Inadvertent Privacy Memorization in Multi-Modal Large Language Models
by: Ju, Tianjie, et al.
Published: (2025)
by: Ju, Tianjie, et al.
Published: (2025)
Probing then Editing Response Personality of Large Language Models
by: Ju, Tianjie, et al.
Published: (2025)
by: Ju, Tianjie, et al.
Published: (2025)
Foresee-to-Ground: From Predictive Temporal Perception to Evidence-Driven Reasoning for Video Temporal Grounding
by: Zheng, Zelin, et al.
Published: (2026)
by: Zheng, Zelin, et al.
Published: (2026)
QIME: Constructing Interpretable Medical Text Embeddings via Ontology-Grounded Questions
by: Tang, Yixuan, et al.
Published: (2026)
by: Tang, Yixuan, et al.
Published: (2026)
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
by: Wang, Yaoting, et al.
Published: (2025)
by: Wang, Yaoting, et al.
Published: (2025)
Hierarchical Local-Global Transformer for Temporal Sentence Grounding
by: Fang, Xiang, et al.
Published: (2022)
by: Fang, Xiang, et al.
Published: (2022)
HULK: Large-scale Hierarchical Coordination under Continual and Uncertain Temporal Tasks
by: Luo, Qingyuan, et al.
Published: (2026)
by: Luo, Qingyuan, et al.
Published: (2026)
Enhancing Federated Class-Incremental Learning via Spatial-Temporal Statistics Aggregation
by: Guan, Zenghao, et al.
Published: (2025)
by: Guan, Zenghao, et al.
Published: (2025)
Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment
by: Li, Bobo, et al.
Published: (2026)
by: Li, Bobo, et al.
Published: (2026)
FormFactory: An Interactive Benchmarking Suite for Multimodal Form-Filling Agents
by: Li, Bobo, et al.
Published: (2025)
by: Li, Bobo, et al.
Published: (2025)
V2Xum-LLM: Cross-Modal Video Summarization with Temporal Prompt Instruction Tuning
by: Hua, Hang, et al.
Published: (2024)
by: Hua, Hang, et al.
Published: (2024)
Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination
by: Li, Xinzhuo, et al.
Published: (2025)
by: Li, Xinzhuo, et al.
Published: (2025)
Faithful Logical Reasoning via Symbolic Chain-of-Thought
by: Xu, Jundong, et al.
Published: (2024)
by: Xu, Jundong, et al.
Published: (2024)
Towards Robust Out-of-Distribution Generalization Bounds via Sharpness
by: Zou, Yingtian, et al.
Published: (2024)
by: Zou, Yingtian, et al.
Published: (2024)
Cross-Domain Feature Augmentation for Domain Generalization
by: Liu, Yingnan, et al.
Published: (2024)
by: Liu, Yingnan, et al.
Published: (2024)
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
by: Fei, Hao, et al.
Published: (2024)
by: Fei, Hao, et al.
Published: (2024)
HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense
by: Li, Siyuan, et al.
Published: (2026)
by: Li, Siyuan, et al.
Published: (2026)
Smoothing Grounding and Reasoning for MLLM-Powered GUI Agents with Query-Oriented Pivot Tasks
by: Wu, Zongru, et al.
Published: (2025)
by: Wu, Zongru, et al.
Published: (2025)
Similar Items
-
Evidence-Based Temporal Fact Verification
by: Barik, Anab Maulana, et al.
Published: (2024) -
ChronoFact: Timeline-based Temporal Fact Verification
by: Barik, Anab Maulana, et al.
Published: (2024) -
Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition
by: Fei, Hao, et al.
Published: (2024) -
VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models
by: Huang, Haojian, et al.
Published: (2025) -
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
by: Liu, Kai, et al.
Published: (2025)