Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Cai, Dongnuan, Du, Henghui, Zhou, Chang, Chen, Xi, Guo, Dan, Zhang, Hongyuan, Li, Xuelong, Hu, Di |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
von: Du, Henghui, et al.
Veröffentlicht: (2025)
von: Du, Henghui, et al.
Veröffentlicht: (2025)
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
von: Li, Guangyao, et al.
Veröffentlicht: (2024)
von: Li, Guangyao, et al.
Veröffentlicht: (2024)
Towards Open-Vocabulary Audio-Visual Event Localization
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
Object-AVEdit: An Object-level Audio-Visual Editing Model
von: Fu, Youquan, et al.
Veröffentlicht: (2025)
von: Fu, Youquan, et al.
Veröffentlicht: (2025)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
von: Zhao, Pengcheng, et al.
Veröffentlicht: (2024)
von: Zhao, Pengcheng, et al.
Veröffentlicht: (2024)
Label-anticipated Event Disentanglement for Audio-Visual Video Parsing
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
von: Li, Zhangbin, et al.
Veröffentlicht: (2024)
von: Li, Zhangbin, et al.
Veröffentlicht: (2024)
On-the-fly Modulation for Balanced Multimodal Learning
von: Wei, Yake, et al.
Veröffentlicht: (2024)
von: Wei, Yake, et al.
Veröffentlicht: (2024)
CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization
von: Zhou, Jinxing, et al.
Veröffentlicht: (2025)
von: Zhou, Jinxing, et al.
Veröffentlicht: (2025)
SonoWorld: From One Image to a 3D Audio-Visual Scene
von: Jin, Derong, et al.
Veröffentlicht: (2026)
von: Jin, Derong, et al.
Veröffentlicht: (2026)
ReSyncer: Rewiring Style-based Generator for Unified Audio-Visually Synced Facial Performer
von: Guan, Jiazhi, et al.
Veröffentlicht: (2024)
von: Guan, Jiazhi, et al.
Veröffentlicht: (2024)
SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding
von: Sun, Qianqian, et al.
Veröffentlicht: (2025)
von: Sun, Qianqian, et al.
Veröffentlicht: (2025)
Bridging Your Imagination with Audio-Video Generation via a Unified Director
von: Zhang, Jiaxu, et al.
Veröffentlicht: (2025)
von: Zhang, Jiaxu, et al.
Veröffentlicht: (2025)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
von: Li, Huilai, et al.
Veröffentlicht: (2026)
von: Li, Huilai, et al.
Veröffentlicht: (2026)
Scene-Text Grounding for Text-Based Video Question Answering
von: Zhou, Sheng, et al.
Veröffentlicht: (2024)
von: Zhou, Sheng, et al.
Veröffentlicht: (2024)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
von: Dai, Yusheng, et al.
Veröffentlicht: (2026)
von: Dai, Yusheng, et al.
Veröffentlicht: (2026)
Unraveling Instance Associations: A Closer Look for Audio-Visual Segmentation
von: Chen, Yuanhong, et al.
Veröffentlicht: (2023)
von: Chen, Yuanhong, et al.
Veröffentlicht: (2023)
Multi-source Multimodal Progressive Domain Adaption for Audio-Visual Deception Detection
von: Lin, Ronghao, et al.
Veröffentlicht: (2025)
von: Lin, Ronghao, et al.
Veröffentlicht: (2025)
ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling
von: Yang, Jianxuan, et al.
Veröffentlicht: (2026)
von: Yang, Jianxuan, et al.
Veröffentlicht: (2026)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
von: Zhou, Sheng, et al.
Veröffentlicht: (2025)
von: Zhou, Sheng, et al.
Veröffentlicht: (2025)
Noise-Tolerant Learning for Audio-Visual Action Recognition
von: Han, Haochen, et al.
Veröffentlicht: (2022)
von: Han, Haochen, et al.
Veröffentlicht: (2022)
Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer
von: Wang, Yaoting, et al.
Veröffentlicht: (2023)
von: Wang, Yaoting, et al.
Veröffentlicht: (2023)
Scaling Audio-Visual Quality Assessment Dataset via Crowdsourcing
von: Yang, Renyu, et al.
Veröffentlicht: (2026)
von: Yang, Renyu, et al.
Veröffentlicht: (2026)
Do LLMs Understand Visual Anomalies? Uncovering LLM's Capabilities in Zero-shot Anomaly Detection
von: Zhu, Jiaqi, et al.
Veröffentlicht: (2024)
von: Zhu, Jiaqi, et al.
Veröffentlicht: (2024)
TEn-CATG:Text-Enriched Audio-Visual Video Parsing with Multi-Scale Category-Aware Temporal Graph
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
von: Chen, Yaru, et al.
Veröffentlicht: (2025)
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
von: Choi, Jeongsoo, et al.
Veröffentlicht: (2023)
von: Choi, Jeongsoo, et al.
Veröffentlicht: (2023)
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation
von: Cheng, Shihao, et al.
Veröffentlicht: (2026)
von: Cheng, Shihao, et al.
Veröffentlicht: (2026)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
von: Zhang, Zhenxing, et al.
Veröffentlicht: (2024)
von: Zhang, Zhenxing, et al.
Veröffentlicht: (2024)
JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
von: Chao, Jianghan, et al.
Veröffentlicht: (2025)
von: Chao, Jianghan, et al.
Veröffentlicht: (2025)
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
von: Li, Zeju, et al.
Veröffentlicht: (2024)
von: Li, Zeju, et al.
Veröffentlicht: (2024)
Spatio-Temporal Data Enhanced Vision-Language Model for Traffic Scene Understanding
von: Ma, Jingtian, et al.
Veröffentlicht: (2025)
von: Ma, Jingtian, et al.
Veröffentlicht: (2025)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
von: Yang, Jianxuan, et al.
Veröffentlicht: (2025)
von: Yang, Jianxuan, et al.
Veröffentlicht: (2025)
Audio-Guided Visual Perception for Audio-Visual Navigation
von: Wang, Yi, et al.
Veröffentlicht: (2025)
von: Wang, Yi, et al.
Veröffentlicht: (2025)
A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation
von: Zhou, S. Z., et al.
Veröffentlicht: (2025)
von: Zhou, S. Z., et al.
Veröffentlicht: (2025)
Emotion-Qwen: A Unified Framework for Emotion and Vision Understanding
von: Huang, Dawei, et al.
Veröffentlicht: (2025)
von: Huang, Dawei, et al.
Veröffentlicht: (2025)
SceneDreamer360: Text-Driven 3D-Consistent Scene Generation with Panoramic Gaussian Splatting
von: Li, Wenrui, et al.
Veröffentlicht: (2024)
von: Li, Wenrui, et al.
Veröffentlicht: (2024)
UniScene: Multi-Camera Unified Pre-training via 3D Scene Reconstruction for Autonomous Driving
von: Min, Chen, et al.
Veröffentlicht: (2023)
von: Min, Chen, et al.
Veröffentlicht: (2023)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
von: Liu, Kai, et al.
Veröffentlicht: (2026)
von: Liu, Kai, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
von: Du, Henghui, et al.
Veröffentlicht: (2025) -
Boosting Audio Visual Question Answering via Key Semantic-Aware Cues
von: Li, Guangyao, et al.
Veröffentlicht: (2024) -
Towards Open-Vocabulary Audio-Visual Event Localization
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024) -
Object-AVEdit: An Object-level Audio-Visual Editing Model
von: Fu, Youquan, et al.
Veröffentlicht: (2025) -
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
von: Zhou, Jinxing, et al.
Veröffentlicht: (2024)