The Telephone Game: Evaluating Semantic Drift in Unified Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Mollah, Sabbir, Gupta, Rohit, Swetha, Sirnam, Liu, Qingyang, Munir, Ahnaf, Shah, Mubarak |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
StretchySnake: Flexible SSM Training Unlocks Action Recognition Across Spatio-Temporal Scales
di: Siddiqui, Nyle, et al.
Pubblicazione: (2025)
di: Siddiqui, Nyle, et al.
Pubblicazione: (2025)
BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models
di: Narnaware, Vishal, et al.
Pubblicazione: (2025)
di: Narnaware, Vishal, et al.
Pubblicazione: (2025)
TimeLogic: A Temporal Logic Benchmark for Video QA
di: Swetha, Sirnam, et al.
Pubblicazione: (2025)
di: Swetha, Sirnam, et al.
Pubblicazione: (2025)
TIGeR: A Unified Framework for Time, Images and Geo-location Retrieval
di: Shatwell, David G., et al.
Pubblicazione: (2026)
di: Shatwell, David G., et al.
Pubblicazione: (2026)
GT-Loc: Unifying When and Where in Images Through a Joint Embedding Space
di: Shatwell, David G., et al.
Pubblicazione: (2025)
di: Shatwell, David G., et al.
Pubblicazione: (2025)
Safe-LLaVA: A Privacy-Preserving Vision-Language Dataset and Benchmark for Biometric Safety
di: Kim, Younggun, et al.
Pubblicazione: (2025)
di: Kim, Younggun, et al.
Pubblicazione: (2025)
VRR-QA: Visual Relational Reasoning in Videos Beyond Explicit Cues
di: Swetha, Sirnam, et al.
Pubblicazione: (2025)
di: Swetha, Sirnam, et al.
Pubblicazione: (2025)
X-Former: Unifying Contrastive and Reconstruction Learning for MLLMs
di: Swetha, Sirnam, et al.
Pubblicazione: (2024)
di: Swetha, Sirnam, et al.
Pubblicazione: (2024)
Cross-View Open-Vocabulary Object Detection in Aerial Imagery
di: Kini, Jyoti, et al.
Pubblicazione: (2025)
di: Kini, Jyoti, et al.
Pubblicazione: (2025)
ColorFoil: Investigating Color Blindness in Large Vision and Language Models
di: Samin, Ahnaf Mozib, et al.
Pubblicazione: (2024)
di: Samin, Ahnaf Mozib, et al.
Pubblicazione: (2024)
VidTAG: Temporally Aligned Video to GPS Geolocalization with Denoising Sequence Prediction at a Global Scale
di: Kulkarni, Parth Parag, et al.
Pubblicazione: (2026)
di: Kulkarni, Parth Parag, et al.
Pubblicazione: (2026)
ViLL-E: Video LLM Embeddings for Retrieval
di: Gupta, Rohit, et al.
Pubblicazione: (2026)
di: Gupta, Rohit, et al.
Pubblicazione: (2026)
Robin3D: Improving 3D Large Language Model via Robust Instruction Tuning
di: Kang, Weitai, et al.
Pubblicazione: (2024)
di: Kang, Weitai, et al.
Pubblicazione: (2024)
PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache
di: Li, Kunyang, et al.
Pubblicazione: (2026)
di: Li, Kunyang, et al.
Pubblicazione: (2026)
Reverse Stable Diffusion: What prompt was used to generate this image?
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2023)
di: Croitoru, Florinel-Alin, et al.
Pubblicazione: (2023)
Evaluation and Enhancement of Semantic Grounding in Large Vision-Language Models
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
di: Lu, Jiaying, et al.
Pubblicazione: (2023)
Can Vision-Language Models Solve the Shell Game?
di: Liu, Tiedong, et al.
Pubblicazione: (2026)
di: Liu, Tiedong, et al.
Pubblicazione: (2026)
LLM Post-Training: A Deep Dive into Reasoning Large Language Models
di: Kumar, Komal, et al.
Pubblicazione: (2025)
di: Kumar, Komal, et al.
Pubblicazione: (2025)
Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks
di: Ashraf, Tajamul, et al.
Pubblicazione: (2025)
di: Ashraf, Tajamul, et al.
Pubblicazione: (2025)
Data Quality Aware Approaches for Addressing Model Drift of Semantic Segmentation Models
di: Mirza, Samiha, et al.
Pubblicazione: (2024)
di: Mirza, Samiha, et al.
Pubblicazione: (2024)
UGen: Unified Autoregressive Multimodal Model with Progressive Vocabulary Learning
di: Tang, Hongxuan, et al.
Pubblicazione: (2025)
di: Tang, Hongxuan, et al.
Pubblicazione: (2025)
A Unified Agentic Framework for Evaluating Conditional Image Generation
di: Wang, Jifang, et al.
Pubblicazione: (2025)
di: Wang, Jifang, et al.
Pubblicazione: (2025)
Enhancing Box and Block Test with Computer Vision for Post-Stroke Upper Extremity Motor Evaluation
di: Robinson, David, et al.
Pubblicazione: (2026)
di: Robinson, David, et al.
Pubblicazione: (2026)
From Play to Replay: Composed Video Retrieval for Temporally Fine-Grained Videos
di: Gupta, Animesh, et al.
Pubblicazione: (2025)
di: Gupta, Animesh, et al.
Pubblicazione: (2025)
Enhancing Privacy-Utility Trade-offs to Mitigate Memorization in Diffusion Models
di: Chen, Chen, et al.
Pubblicazione: (2025)
di: Chen, Chen, et al.
Pubblicazione: (2025)
Exploring Local Memorization in Diffusion Models via Bright Ending Attention
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
From Reasoning to Pixels: Benchmarking the Alignment Gap in Unified Multimodal Models
di: Yang, Cheng, et al.
Pubblicazione: (2026)
di: Yang, Cheng, et al.
Pubblicazione: (2026)
ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction
di: Guo, Zichun, et al.
Pubblicazione: (2026)
di: Guo, Zichun, et al.
Pubblicazione: (2026)
D$^{3}$ToM: Decider-Guided Dynamic Token Merging for Accelerating Diffusion MLLMs
di: Chang, Shuochen, et al.
Pubblicazione: (2025)
di: Chang, Shuochen, et al.
Pubblicazione: (2025)
SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing
di: Biyyala, Varun, et al.
Pubblicazione: (2025)
di: Biyyala, Varun, et al.
Pubblicazione: (2025)
Investigating Memorization in Video Diffusion Models
di: Chen, Chen, et al.
Pubblicazione: (2024)
di: Chen, Chen, et al.
Pubblicazione: (2024)
Open Vocabulary Multi-Label Video Classification
di: Gupta, Rohit, et al.
Pubblicazione: (2024)
di: Gupta, Rohit, et al.
Pubblicazione: (2024)
Sharing the Cost of Success: A Game for Evaluating and Learning Collaborative Multi-Agent Instruction Giving and Following Policies
di: Sadler, Philipp, et al.
Pubblicazione: (2024)
di: Sadler, Philipp, et al.
Pubblicazione: (2024)
HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment
di: Wu, Ruijia, et al.
Pubblicazione: (2025)
di: Wu, Ruijia, et al.
Pubblicazione: (2025)
Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs
di: Narnaware, Vishal, et al.
Pubblicazione: (2026)
di: Narnaware, Vishal, et al.
Pubblicazione: (2026)
UEval: A Benchmark for Unified Multimodal Generation
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
Video-Text Dataset Construction from Multi-AI Feedback: Promoting Weak-to-Strong Preference Learning for Video Large Language Models
di: Yi, Hao, et al.
Pubblicazione: (2024)
di: Yi, Hao, et al.
Pubblicazione: (2024)
ElectroVizQA: How well do Multi-modal LLMs perform in Electronics Visual Question Answering?
di: Meshram, Pragati Shuddhodhan, et al.
Pubblicazione: (2024)
di: Meshram, Pragati Shuddhodhan, et al.
Pubblicazione: (2024)
UniChange: Unifying Change Detection with Multimodal Large Language Model
di: Zhang, Xu, et al.
Pubblicazione: (2025)
di: Zhang, Xu, et al.
Pubblicazione: (2025)
A Unified Hallucination Mitigation Framework for Large Vision-Language Models
di: Chang, Yue, et al.
Pubblicazione: (2024)
di: Chang, Yue, et al.
Pubblicazione: (2024)
Documenti analoghi
-
StretchySnake: Flexible SSM Training Unlocks Action Recognition Across Spatio-Temporal Scales
di: Siddiqui, Nyle, et al.
Pubblicazione: (2025) -
BBQ-V: Benchmarking Visual Stereotype Bias in Large Multimodal Models
di: Narnaware, Vishal, et al.
Pubblicazione: (2025) -
TimeLogic: A Temporal Logic Benchmark for Video QA
di: Swetha, Sirnam, et al.
Pubblicazione: (2025) -
TIGeR: A Unified Framework for Time, Images and Geo-location Retrieval
di: Shatwell, David G., et al.
Pubblicazione: (2026) -
GT-Loc: Unifying When and Where in Images Through a Joint Embedding Space
di: Shatwell, David G., et al.
Pubblicazione: (2025)