Salvato in:
| Autori principali: | Chao, Jianghan, Gao, Jianzhang, Tan, Wenhui, Sun, Yuchong, Song, Ruihua, Ru, Liyun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2512.12772 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
di: Yang, Jialiang, et al.
Pubblicazione: (2026)
ChronusOmni: Improving Time Awareness of Omni Large Language Models
di: Chen, Yijing, et al.
Pubblicazione: (2025)
di: Chen, Yijing, et al.
Pubblicazione: (2025)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
di: Su, Yaofeng, et al.
Pubblicazione: (2026)
di: Su, Yaofeng, et al.
Pubblicazione: (2026)
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
di: Guo, Xinyue, et al.
Pubblicazione: (2025)
VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding
di: Gao, Shibo, et al.
Pubblicazione: (2025)
di: Gao, Shibo, et al.
Pubblicazione: (2025)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
di: Liu, Kai, et al.
Pubblicazione: (2026)
di: Liu, Kai, et al.
Pubblicazione: (2026)
MicroEmo: Time-Sensitive Multimodal Emotion Recognition with Micro-Expression Dynamics in Video Dialogues
di: Zhang, Liyun
Pubblicazione: (2024)
di: Zhang, Liyun
Pubblicazione: (2024)
Aligning Audio-Visual Joint Representations with an Agentic Workflow
di: Mo, Shentong, et al.
Pubblicazione: (2024)
di: Mo, Shentong, et al.
Pubblicazione: (2024)
QGFace: Quality-Guided Joint Training For Mixed-Quality Face Recognition
di: Song, Youzhe, et al.
Pubblicazione: (2023)
di: Song, Youzhe, et al.
Pubblicazione: (2023)
Diffusion Models for Joint Audio-Video Generation
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
di: La Torre, Alejandro Paredes
Pubblicazione: (2026)
Adaptive Low Light Enhancement via Joint Global-Local Illumination Adjustment
di: Wang, Haodian, et al.
Pubblicazione: (2025)
di: Wang, Haodian, et al.
Pubblicazione: (2025)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
di: Chen, Yuheng, et al.
Pubblicazione: (2026)
Audio-Visual Speech Enhancement In Complex Scenarios With Separation And Dereverberation Joint Modeling
di: Du, Jiarong, et al.
Pubblicazione: (2025)
di: Du, Jiarong, et al.
Pubblicazione: (2025)
TR-DETR: Task-Reciprocal Transformer for Joint Moment Retrieval and Highlight Detection
di: Sun, Hao, et al.
Pubblicazione: (2024)
di: Sun, Hao, et al.
Pubblicazione: (2024)
Apollo: Unified Multi-Task Audio-Video Joint Generation
di: Wang, Jun, et al.
Pubblicazione: (2026)
di: Wang, Jun, et al.
Pubblicazione: (2026)
Do Joint Audio-Video Generation Models Understand Physics?
di: Cui, Zijun, et al.
Pubblicazione: (2026)
di: Cui, Zijun, et al.
Pubblicazione: (2026)
AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers
di: Araujo, Edson, et al.
Pubblicazione: (2026)
di: Araujo, Edson, et al.
Pubblicazione: (2026)
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling
di: Ye, Zhen, et al.
Pubblicazione: (2026)
di: Ye, Zhen, et al.
Pubblicazione: (2026)
Audio-Guided Visual Perception for Audio-Visual Navigation
di: Wang, Yi, et al.
Pubblicazione: (2025)
di: Wang, Yi, et al.
Pubblicazione: (2025)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
di: Chen, Yaru, et al.
Pubblicazione: (2025)
di: Chen, Yaru, et al.
Pubblicazione: (2025)
Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning
di: Zhao, Zhixian, et al.
Pubblicazione: (2026)
di: Zhao, Zhixian, et al.
Pubblicazione: (2026)
Joint Flow And Feature Refinement Using Attention For Video Restoration
di: Merugu, Ranjith, et al.
Pubblicazione: (2025)
di: Merugu, Ranjith, et al.
Pubblicazione: (2025)
Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation
di: Li, Chunyu, et al.
Pubblicazione: (2026)
di: Li, Chunyu, et al.
Pubblicazione: (2026)
Noise-Tolerant Learning for Audio-Visual Action Recognition
di: Han, Haochen, et al.
Pubblicazione: (2022)
di: Han, Haochen, et al.
Pubblicazione: (2022)
Towards Open-Vocabulary Audio-Visual Event Localization
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
VinTAGe: Joint Video and Text Conditioning for Holistic Audio Generation
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
di: Kushwaha, Saksham Singh, et al.
Pubblicazione: (2024)
Scaling Audio-Visual Quality Assessment Dataset via Crowdsourcing
di: Yang, Renyu, et al.
Pubblicazione: (2026)
di: Yang, Renyu, et al.
Pubblicazione: (2026)
SonoWorld: From One Image to a 3D Audio-Visual Scene
di: Jin, Derong, et al.
Pubblicazione: (2026)
di: Jin, Derong, et al.
Pubblicazione: (2026)
Joint Explicit and Implicit Cross-Modal Interaction Network for Anterior Chamber Inflammation Diagnosis
di: Shao, Qian, et al.
Pubblicazione: (2023)
di: Shao, Qian, et al.
Pubblicazione: (2023)
DreamMesh: Jointly Manipulating and Texturing Triangle Meshes for Text-to-3D Generation
di: Yang, Haibo, et al.
Pubblicazione: (2024)
di: Yang, Haibo, et al.
Pubblicazione: (2024)
Unraveling Instance Associations: A Closer Look for Audio-Visual Segmentation
di: Chen, Yuanhong, et al.
Pubblicazione: (2023)
di: Chen, Yuanhong, et al.
Pubblicazione: (2023)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
di: Li, Zhangbin, et al.
Pubblicazione: (2024)
di: Li, Zhangbin, et al.
Pubblicazione: (2024)
AV-SUPERB: A Multi-Task Evaluation Benchmark for Audio-Visual Representation Models
di: Tseng, Yuan, et al.
Pubblicazione: (2023)
di: Tseng, Yuan, et al.
Pubblicazione: (2023)
Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
di: Zhao, Pengcheng, et al.
Pubblicazione: (2024)
Multi-source Multimodal Progressive Domain Adaption for Audio-Visual Deception Detection
di: Lin, Ronghao, et al.
Pubblicazione: (2025)
di: Lin, Ronghao, et al.
Pubblicazione: (2025)
A Sleep Monitoring System Based on Audio, Video and Depth Information
di: Chen, Lyn Chao-ling, et al.
Pubblicazione: (2025)
di: Chen, Lyn Chao-ling, et al.
Pubblicazione: (2025)
See or Guess: Counterfactually Regularized Image Captioning
di: Cao, Qian, et al.
Pubblicazione: (2024)
di: Cao, Qian, et al.
Pubblicazione: (2024)
Causal Debiasing for Visual Commonsense Reasoning
di: Zou, Jiayi, et al.
Pubblicazione: (2025)
di: Zou, Jiayi, et al.
Pubblicazione: (2025)
Deep-JGAC: End-to-End Deep Joint Geometry and Attribute Compression for Dense Colored Point Clouds
di: Zhang, Yun, et al.
Pubblicazione: (2025)
di: Zhang, Yun, et al.
Pubblicazione: (2025)
Benchmarking Cross-Domain Audio-Visual Deception Detection
di: Guo, Xiaobao, et al.
Pubblicazione: (2024)
di: Guo, Xiaobao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models
di: Yang, Jialiang, et al.
Pubblicazione: (2026) -
ChronusOmni: Improving Time Awareness of Omni Large Language Models
di: Chen, Yijing, et al.
Pubblicazione: (2025) -
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
di: Su, Yaofeng, et al.
Pubblicazione: (2026) -
AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control
di: Guo, Xinyue, et al.
Pubblicazione: (2025) -
VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding
di: Gao, Shibo, et al.
Pubblicazione: (2025)