AVTrustBench: Assessing and Enhancing Reliability and Robustness in Audio-Visual LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Chowdhury, Sanjoy, Nag, Sayan, Dasgupta, Subhrajyoti, Wang, Yaoting, Elhoseiny, Mohamed, Gao, Ruohan, Manocha, Dinesh |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2024)
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2024)
Aurelia: Test-time Reasoning Distillation in Audio-Visual LLMs
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning
di: Galougah, Siminfar Samakoush, et al.
Pubblicazione: (2025)
di: Galougah, Siminfar Samakoush, et al.
Pubblicazione: (2025)
MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion Models
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2024)
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2024)
EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025)
AV-RIR: Audio-Visual Room Impulse Response Estimation
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
StoryGPT-V: Large Language Models as Consistent Story Visualizers
di: Shen, Xiaoqian, et al.
Pubblicazione: (2023)
di: Shen, Xiaoqian, et al.
Pubblicazione: (2023)
ASPIRE: Language-Guided Data Augmentation for Improving Robustness Against Spurious Correlations
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
di: Ghosh, Sreyan, et al.
Pubblicazione: (2023)
Perceptually Optimized Color Selection for Visualization
di: Maji, Subhrajyoti, et al.
Pubblicazione: (2022)
di: Maji, Subhrajyoti, et al.
Pubblicazione: (2022)
Uncovering the Representation Geometry of Minimal Cores in Overcomplete Reasoning Traces
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2026)
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2026)
CalibFree: Self-Supervised View Feature Separation for Calibration-Free Multi-Camera Multi-Object Tracking
di: Xian, Ruiqi, et al.
Pubblicazione: (2026)
di: Xian, Ruiqi, et al.
Pubblicazione: (2026)
Inst4DGS: Instance-Decomposed 4D Gaussian Splatting with Multi-Video Label Permutation Learning
di: Lee, Yonghan, et al.
Pubblicazione: (2026)
di: Lee, Yonghan, et al.
Pubblicazione: (2026)
MotionHint: Self-Supervised Monocular Visual Odometry with Motion Constraints
di: Wang, Cong, et al.
Pubblicazione: (2021)
di: Wang, Cong, et al.
Pubblicazione: (2021)
Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs
di: Gandhi, Mona, et al.
Pubblicazione: (2026)
di: Gandhi, Mona, et al.
Pubblicazione: (2026)
Stepping Stones: A Progressive Training Strategy for Audio-Visual Semantic Segmentation
di: Ma, Juncheng, et al.
Pubblicazione: (2024)
di: Ma, Juncheng, et al.
Pubblicazione: (2024)
PACE: Data-Driven Virtual Agent Interaction in Dense and Cluttered Environments
di: Mullen, James, et al.
Pubblicazione: (2023)
di: Mullen, James, et al.
Pubblicazione: (2023)
BoMuDANet: Unsupervised Adaptation for Visual Scene Understanding in Unstructured Driving Environments
di: Kothandaraman, Divya, et al.
Pubblicazione: (2020)
di: Kothandaraman, Divya, et al.
Pubblicazione: (2020)
RPG360: Robust 360 Depth Estimation with Perspective Foundation Models and Graph Optimization
di: Jung, Dongki, et al.
Pubblicazione: (2025)
di: Jung, Dongki, et al.
Pubblicazione: (2025)
EgoAVU: Egocentric Audio-Visual Understanding
di: Seth, Ashish, et al.
Pubblicazione: (2026)
di: Seth, Ashish, et al.
Pubblicazione: (2026)
CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding
di: Abdelrahman, Eslam, et al.
Pubblicazione: (2023)
di: Abdelrahman, Eslam, et al.
Pubblicazione: (2023)
Can LLMs Generate Human-Like Wayfinding Instructions? Towards Platform-Agnostic Embodied Instruction Synthesis
di: Dorbala, Vishnu Sashank, et al.
Pubblicazione: (2024)
di: Dorbala, Vishnu Sashank, et al.
Pubblicazione: (2024)
MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens
di: Ataallah, Kirolos, et al.
Pubblicazione: (2024)
di: Ataallah, Kirolos, et al.
Pubblicazione: (2024)
SonoWorld: From One Image to a 3D Audio-Visual Scene
di: Jin, Derong, et al.
Pubblicazione: (2026)
di: Jin, Derong, et al.
Pubblicazione: (2026)
Ref-AVS: Refer and Segment Objects in Audio-Visual Scenes
di: Wang, Yaoting, et al.
Pubblicazione: (2024)
di: Wang, Yaoting, et al.
Pubblicazione: (2024)
The Audio-Visual Conversational Graph: From an Egocentric-Exocentric Perspective
di: Jia, Wenqi, et al.
Pubblicazione: (2023)
di: Jia, Wenqi, et al.
Pubblicazione: (2023)
Financial Models in Generative Art: Black-Scholes-Inspired Concept Blending in Text-to-Image Diffusion
di: Kothandaraman, Divya, et al.
Pubblicazione: (2024)
di: Kothandaraman, Divya, et al.
Pubblicazione: (2024)
Differentiable Frequency-based Disentanglement for Aerial Video Action Recognition
di: Kothandaraman, Divya, et al.
Pubblicazione: (2022)
di: Kothandaraman, Divya, et al.
Pubblicazione: (2022)
Speech2UnifiedExpressions: Synchronous Synthesis of Co-Speech Affective Face and Body Expressions from Affordable Inputs
di: Bhattacharya, Uttaran, et al.
Pubblicazione: (2024)
di: Bhattacharya, Uttaran, et al.
Pubblicazione: (2024)
SS-SFDA : Self-Supervised Source-Free Domain Adaptation for Road Segmentation in Hazardous Environments
di: Kothandaraman, Divya, et al.
Pubblicazione: (2020)
di: Kothandaraman, Divya, et al.
Pubblicazione: (2020)
SLAT-Phys: Fast Material Property Field Prediction from Structured 3D Latents
di: Das, Rocktim Jyoti, et al.
Pubblicazione: (2026)
di: Das, Rocktim Jyoti, et al.
Pubblicazione: (2026)
VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding
di: Li, Xiang, et al.
Pubblicazione: (2024)
di: Li, Xiang, et al.
Pubblicazione: (2024)
Spherical World-Locking for Audio-Visual Localization in Egocentric Videos
di: Yun, Heeseung, et al.
Pubblicazione: (2024)
di: Yun, Heeseung, et al.
Pubblicazione: (2024)
InfiniBench: A Benchmark for Large Multi-Modal Models in Long-Form Movies and TV Shows
di: Ataallah, Kirolos, et al.
Pubblicazione: (2024)
di: Ataallah, Kirolos, et al.
Pubblicazione: (2024)
LoLep: Single-View View Synthesis with Locally-Learned Planes and Self-Attention Occlusion Inference
di: Wang, Cong, et al.
Pubblicazione: (2023)
di: Wang, Cong, et al.
Pubblicazione: (2023)
EgoSocial: Benchmarking Proactive Intervention Ability of Omnimodal LLMs via Egocentric Social Interaction Perception
di: Wang, Xijun, et al.
Pubblicazione: (2025)
di: Wang, Xijun, et al.
Pubblicazione: (2025)
V-Trans4Style: Visual Transition Recommendation for Video Production Style Adaptation
di: Guhan, Pooja, et al.
Pubblicazione: (2025)
di: Guhan, Pooja, et al.
Pubblicazione: (2025)
Towards a Systematic Evaluation of Hallucinations in Large-Vision Language Models
di: Seth, Ashish, et al.
Pubblicazione: (2024)
di: Seth, Ashish, et al.
Pubblicazione: (2024)
Listen2Scene: Interactive material-aware binaural sound propagation for reconstructed 3D scenes
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
di: Ratnarajah, Anton, et al.
Pubblicazione: (2023)
Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer
di: Wang, Yaoting, et al.
Pubblicazione: (2023)
di: Wang, Yaoting, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Meerkat: Audio-Visual Large Language Model for Grounding in Space and Time
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2024) -
Aurelia: Test-time Reasoning Distillation in Audio-Visual LLMs
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025) -
MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2025) -
AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning
di: Galougah, Siminfar Samakoush, et al.
Pubblicazione: (2025) -
MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion Models
di: Chowdhury, Sanjoy, et al.
Pubblicazione: (2024)