Enregistré dans:
| Auteurs principaux: | Xia, Hou, Fu, Zheren, Ling, Fangcan, Li, Jiajun, Tu, Yi, Mao, Zhendong, Zhang, Yongdong |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2508.19650 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
par: Zhang, Huatian, et autres
Publié: (2026)
par: Zhang, Huatian, et autres
Publié: (2026)
SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder
par: Liu, Dengcan, et autres
Publié: (2025)
par: Liu, Dengcan, et autres
Publié: (2025)
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
par: Wu, Bin, et autres
Publié: (2026)
par: Wu, Bin, et autres
Publié: (2026)
DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization
par: Wang, Wenchuan, et autres
Publié: (2025)
par: Wang, Wenchuan, et autres
Publié: (2025)
Lance: Unified Multimodal Modeling by Multi-Task Synergy
par: Fu, Fengyi, et autres
Publié: (2026)
par: Fu, Fengyi, et autres
Publié: (2026)
FACE-net: Factual Calibration and Emotion Augmentation for Retrieval-enhanced Emotional Video Captioning
par: Chen, Weidong, et autres
Publié: (2026)
par: Chen, Weidong, et autres
Publié: (2026)
SVLTA: Benchmarking Vision-Language Temporal Alignment via Synthetic Video Situation
par: Du, Hao, et autres
Publié: (2025)
par: Du, Hao, et autres
Publié: (2025)
Sentiment-oriented Transformer-based Variational Autoencoder Network for Live Video Commenting
par: Fu, Fengyi, et autres
Publié: (2024)
par: Fu, Fengyi, et autres
Publié: (2024)
Leveraging Robust Optimization for LLM Alignment under Distribution Shifts
par: Zhu, Mingye, et autres
Publié: (2025)
par: Zhu, Mingye, et autres
Publié: (2025)
Stream-T1: Test-Time Scaling for Streaming Video Generation
par: Tu, Yijing, et autres
Publié: (2026)
par: Tu, Yijing, et autres
Publié: (2026)
Exploring Enhanced Contextual Information for Video-Level Object Tracking
par: Kang, Ben, et autres
Publié: (2024)
par: Kang, Ben, et autres
Publié: (2024)
SpaceVLLM: Endowing Multimodal Large Language Model with Spatio-Temporal Video Grounding Capability
par: Wang, Jiankang, et autres
Publié: (2025)
par: Wang, Jiankang, et autres
Publié: (2025)
RealCustom: Narrowing Real Text Word for Real-Time Open-Domain Text-to-Image Customization
par: Huang, Mengqi, et autres
Publié: (2024)
par: Huang, Mengqi, et autres
Publié: (2024)
DSE-GAN: Dynamic Semantic Evolution Generative Adversarial Network for Text-to-Image Generation
par: Huang, Mengqi, et autres
Publié: (2022)
par: Huang, Mengqi, et autres
Publié: (2022)
VideoLLM-online: Online Video Large Language Model for Streaming Video
par: Chen, Joya, et autres
Publié: (2024)
par: Chen, Joya, et autres
Publié: (2024)
RealGeneral: Unifying Visual Generation via Temporal In-Context Learning with Video Models
par: Lin, Yijing, et autres
Publié: (2025)
par: Lin, Yijing, et autres
Publié: (2025)
RealCustom++: Representing Images as Real Textual Word for Real-Time Customization
par: Mao, Zhendong, et autres
Publié: (2024)
par: Mao, Zhendong, et autres
Publié: (2024)
DACL-RAG: Data Augmentation Strategy with Curriculum Learning for Retrieval-Augmented Generation
par: Wang, Shaohan, et autres
Publié: (2025)
par: Wang, Shaohan, et autres
Publié: (2025)
Dual-path Collaborative Generation Network for Emotional Video Captioning
par: Ye, Cheng, et autres
Publié: (2024)
par: Ye, Cheng, et autres
Publié: (2024)
Investigating Video Reasoning Capability of Large Language Models with Tropes in Movies
par: Su, Hung-Ting, et autres
Publié: (2024)
par: Su, Hung-Ting, et autres
Publié: (2024)
T-SVG: Text-Driven Stereoscopic Video Generation
par: Jin, Qiao, et autres
Publié: (2024)
par: Jin, Qiao, et autres
Publié: (2024)
ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping
par: Pang, Youxin, et autres
Publié: (2024)
par: Pang, Youxin, et autres
Publié: (2024)
CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers
par: Chen, Weidong, et autres
Publié: (2026)
par: Chen, Weidong, et autres
Publié: (2026)
Geometry-Aware Rotary Position Embedding for Consistent Video World Model
par: Xiang, Chendong, et autres
Publié: (2026)
par: Xiang, Chendong, et autres
Publié: (2026)
Contextualized Diffusion Models for Text-Guided Image and Video Generation
par: Yang, Ling, et autres
Publié: (2024)
par: Yang, Ling, et autres
Publié: (2024)
Vision-Language Models Assisted Unsupervised Video Anomaly Detection
par: Jiang, Yalong, et autres
Publié: (2024)
par: Jiang, Yalong, et autres
Publié: (2024)
Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
par: Luo, Yongdong, et autres
Publié: (2024)
par: Luo, Yongdong, et autres
Publié: (2024)
Linear Scaling Video VLMs for Long Video Understanding
par: Eyzaguirre, Cristobal, et autres
Publié: (2026)
par: Eyzaguirre, Cristobal, et autres
Publié: (2026)
Video Summarization with Large Language Models
par: Lee, Min Jung, et autres
Publié: (2025)
par: Lee, Min Jung, et autres
Publié: (2025)
ViLLa: Video Reasoning Segmentation with Large Language Model
par: Zheng, Rongkun, et autres
Publié: (2024)
par: Zheng, Rongkun, et autres
Publié: (2024)
VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos
par: Munasinghe, Shehan, et autres
Publié: (2024)
par: Munasinghe, Shehan, et autres
Publié: (2024)
Tango: Taming Visual Signals for Efficient Video Large Language Models
par: Yin, Shukang, et autres
Publié: (2026)
par: Yin, Shukang, et autres
Publié: (2026)
HOIGen-1M: A Large-scale Dataset for Human-Object Interaction Video Generation
par: Liu, Kun, et autres
Publié: (2025)
par: Liu, Kun, et autres
Publié: (2025)
Video-CCAM: Enhancing Video-Language Understanding with Causal Cross-Attention Masks for Short and Long Videos
par: Fei, Jiajun, et autres
Publié: (2024)
par: Fei, Jiajun, et autres
Publié: (2024)
DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs
par: Park, Minyoung, et autres
Publié: (2026)
par: Park, Minyoung, et autres
Publié: (2026)
Generative Ghost: Investigating Ranking Bias Hidden in AI-Generated Videos
par: Gao, Haowen, et autres
Publié: (2025)
par: Gao, Haowen, et autres
Publié: (2025)
Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models
par: Cao, Meng, et autres
Publié: (2025)
par: Cao, Meng, et autres
Publié: (2025)
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Enhancing Video Large Language Models with Structured Multi-Video Collaborative Reasoning
par: He, Zhihao, et autres
Publié: (2025)
par: He, Zhihao, et autres
Publié: (2025)
Large Language Models for Video Surveillance Applications
par: De Silva, Ulindu, et autres
Publié: (2025)
par: De Silva, Ulindu, et autres
Publié: (2025)
Documents similaires
-
Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models
par: Zhang, Huatian, et autres
Publié: (2026) -
SparseRM: A Lightweight Preference Modeling with Sparse Autoencoder
par: Liu, Dengcan, et autres
Publié: (2025) -
Stream-R1: Reliability-Perplexity Aware Reward Distillation for Streaming Video Generation
par: Wu, Bin, et autres
Publié: (2026) -
DualReal: Adaptive Joint Training for Lossless Identity-Motion Fusion in Video Customization
par: Wang, Wenchuan, et autres
Publié: (2025) -
Lance: Unified Multimodal Modeling by Multi-Task Synergy
par: Fu, Fengyi, et autres
Publié: (2026)