Enregistré dans:
| Auteurs principaux: | Zhao, Zijian, Jin, Dian, Zhou, Zijing, Zhang, Xiaoyu |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2605.03660 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Automatic Stage Lighting Control: Is it a Rule-Driven Process or Generative Task?
par: Zhao, Zijian, et autres
Publié: (2025)
par: Zhao, Zijian, et autres
Publié: (2025)
Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach
par: Zhao, Zijian, et autres
Publié: (2025)
par: Zhao, Zijian, et autres
Publié: (2025)
Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning
par: Jin, Zeyu, et autres
Publié: (2026)
par: Jin, Zeyu, et autres
Publié: (2026)
LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?
par: Wang, Xiaohan, et autres
Publié: (2026)
par: Wang, Xiaohan, et autres
Publié: (2026)
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
par: Li, Haitian, et autres
Publié: (2026)
par: Li, Haitian, et autres
Publié: (2026)
PlanLLM: Video Procedure Planning with Refinable Large Language Models
par: Yang, Dejie, et autres
Publié: (2024)
par: Yang, Dejie, et autres
Publié: (2024)
VidCRAFT3: Camera, Object, and Lighting Control for Image-to-Video Generation
par: Zheng, Sixiao, et autres
Publié: (2025)
par: Zheng, Sixiao, et autres
Publié: (2025)
DiTCtrl: Exploring Attention Control in Multi-Modal Diffusion Transformer for Tuning-Free Multi-Prompt Longer Video Generation
par: Cai, Minghong, et autres
Publié: (2024)
par: Cai, Minghong, et autres
Publié: (2024)
SimLabel: Similarity-Weighted Iterative Framework for Multi-annotator Learning with Missing Annotations
par: Zhang, Liyun, et autres
Publié: (2025)
par: Zhang, Liyun, et autres
Publié: (2025)
ELF: A Family of Encoder-Free ECG-Language Models
par: Han, William, et autres
Publié: (2026)
par: Han, William, et autres
Publié: (2026)
Adaptive Social Metaverse Streaming based on Federated Multi-Agent Deep Reinforcement Learning
par: Long, Zijian, et autres
Publié: (2025)
par: Long, Zijian, et autres
Publié: (2025)
Stage-Adaptive Reliability Modeling for Continuous Valence-Arousal Estimation
par: Lee, Yubeen, et autres
Publié: (2026)
par: Lee, Yubeen, et autres
Publié: (2026)
LightThinker: Thinking Step-by-Step Compression
par: Zhang, Jintian, et autres
Publié: (2025)
par: Zhang, Jintian, et autres
Publié: (2025)
Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs
par: Chen, Jianhao, et autres
Publié: (2026)
par: Chen, Jianhao, et autres
Publié: (2026)
TIP and Polish: Text-Image-Prototype Guided Multi-Modal Generation via Commonality-Discrepancy Modeling and Refinement
par: Ma, Zhiyong, et autres
Publié: (2025)
par: Ma, Zhiyong, et autres
Publié: (2025)
EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction
par: Jing, Chong, et autres
Publié: (2026)
par: Jing, Chong, et autres
Publié: (2026)
Sequence-to-Sequence Multi-Modal Speech In-Painting
par: Elyaderani, Mahsa Kadkhodaei, et autres
Publié: (2024)
par: Elyaderani, Mahsa Kadkhodaei, et autres
Publié: (2024)
LightThinker++: From Reasoning Compression to Memory Management
par: Zhu, Yuqi, et autres
Publié: (2026)
par: Zhu, Yuqi, et autres
Publié: (2026)
A Split-Window Transformer for Multi-Model Sequence Spammer Detection using Multi-Model Variational Autoencoder
par: Yang, Zhou, et autres
Publié: (2025)
par: Yang, Zhou, et autres
Publié: (2025)
AniME: Adaptive Multi-Agent Planning for Long Animation Generation
par: Zhang, Lisai, et autres
Publié: (2025)
par: Zhang, Lisai, et autres
Publié: (2025)
Wireless Video Semantic Communication with Decoupled Diffusion Multi-frame Compensation
par: Xie, Bingyan, et autres
Publié: (2025)
par: Xie, Bingyan, et autres
Publié: (2025)
Chinese-LiPS: A Chinese audio-visual speech recognition dataset with Lip-reading and Presentation Slides
par: Zhao, Jinghua, et autres
Publié: (2025)
par: Zhao, Jinghua, et autres
Publié: (2025)
CARAT: Contrastive Feature Reconstruction and Aggregation for Multi-Modal Multi-Label Emotion Recognition
par: Peng, Cheng, et autres
Publié: (2023)
par: Peng, Cheng, et autres
Publié: (2023)
M3TR: Temporal Retrieval Enhanced Multi-Modal Micro-video Popularity Prediction
par: Lu, Jiacheng, et autres
Publié: (2024)
par: Lu, Jiacheng, et autres
Publié: (2024)
Multimodal Emotion Recognition by Fusing Video Semantic in MOOC Learning Scenarios
par: Zhang, Yuan, et autres
Publié: (2024)
par: Zhang, Yuan, et autres
Publié: (2024)
A Survey of Multi-sensor Fusion Perception for Embodied AI: Background, Methods, Challenges and Prospects
par: Ruan, Shulan, et autres
Publié: (2025)
par: Ruan, Shulan, et autres
Publié: (2025)
Synthesizing Sentiment-Controlled Feedback For Multimodal Text and Image Data
par: Kumar, Puneet, et autres
Publié: (2024)
par: Kumar, Puneet, et autres
Publié: (2024)
Retrieval-Augmented Generation for Electrocardiogram-Language Models
par: Song, Xiaoyu, et autres
Publié: (2025)
par: Song, Xiaoyu, et autres
Publié: (2025)
Robust Multi-Modal Speech In-Painting: A Sequence-to-Sequence Approach
par: Elyaderani, Mahsa Kadkhodaei, et autres
Publié: (2024)
par: Elyaderani, Mahsa Kadkhodaei, et autres
Publié: (2024)
HeLo: Heterogeneous Multi-Modal Fusion with Label Correlation for Emotion Distribution Learning
par: Zheng, Chuhang, et autres
Publié: (2025)
par: Zheng, Chuhang, et autres
Publié: (2025)
Semantic-Guided Unsupervised Video Summarization
par: Liu, Haizhou, et autres
Publié: (2026)
par: Liu, Haizhou, et autres
Publié: (2026)
Morphe: High-Fidelity Generative Video Streaming with Vision Foundation Model
par: Gong, Tianyi, et autres
Publié: (2026)
par: Gong, Tianyi, et autres
Publié: (2026)
MM-HSD: Multi-Modal Hate Speech Detection in Videos
par: Céspedes-Sarrias, Berta, et autres
Publié: (2025)
par: Céspedes-Sarrias, Berta, et autres
Publié: (2025)
OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination
par: Chen, Junzhe, et autres
Publié: (2025)
par: Chen, Junzhe, et autres
Publié: (2025)
FineFake: A Knowledge-Enriched Dataset for Fine-Grained Multi-Domain Fake News Detection
par: Zhou, Ziyi, et autres
Publié: (2024)
par: Zhou, Ziyi, et autres
Publié: (2024)
Uni-Retrieval: A Multi-Style Retrieval Framework for STEM's Education
par: Jia, Yanhao, et autres
Publié: (2025)
par: Jia, Yanhao, et autres
Publié: (2025)
Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification
par: Nguyen, Truong Thanh Hung, et autres
Publié: (2026)
par: Nguyen, Truong Thanh Hung, et autres
Publié: (2026)
BlobCtrl: Taming Controllable Blob for Element-level Image Editing
par: Li, Yaowei, et autres
Publié: (2025)
par: Li, Yaowei, et autres
Publié: (2025)
A Multi-modal Fusion Network for Terrain Perception Based on Illumination Aware
par: Wang, Rui, et autres
Publié: (2025)
par: Wang, Rui, et autres
Publié: (2025)
Robust Audio Anti-Spoofing with Fusion-Reconstruction Learning on Multi-Order Spectrograms
par: Wen, Penghui, et autres
Publié: (2023)
par: Wen, Penghui, et autres
Publié: (2023)
Documents similaires
-
Automatic Stage Lighting Control: Is it a Rule-Driven Process or Generative Task?
par: Zhao, Zijian, et autres
Publié: (2025) -
Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach
par: Zhao, Zijian, et autres
Publié: (2025) -
Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning
par: Jin, Zeyu, et autres
Publié: (2026) -
LiveK12Bench: Have Large Multimodal Models Truly Conquered High School-level Examinations?
par: Wang, Xiaohan, et autres
Publié: (2026) -
MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation
par: Li, Haitian, et autres
Publié: (2026)