Towards Universal Video MLLMs with Attribute-Structured and Quality-Verified Instructions
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Yunheng, Zhang, Hengrui, Guo, Meng-Hao, Gao, Wenzhao, Jia, Shaoyong, Jiao, Shaohui, Hou, Qibin, Cheng, Ming-Ming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
di: Li, Yunheng, et al.
Pubblicazione: (2025)
di: Li, Yunheng, et al.
Pubblicazione: (2025)
Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought
di: Li, Yunheng, et al.
Pubblicazione: (2026)
di: Li, Yunheng, et al.
Pubblicazione: (2026)
High-Quality Mask Tuning Matters for Open-Vocabulary Segmentation
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2024)
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2024)
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
di: Li, Yunheng, et al.
Pubblicazione: (2024)
di: Li, Yunheng, et al.
Pubblicazione: (2024)
Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction
di: Li, Yunheng, et al.
Pubblicazione: (2024)
di: Li, Yunheng, et al.
Pubblicazione: (2024)
Revisiting Efficient Semantic Segmentation: Learning Offsets for Better Spatial and Class Feature Alignment
di: Zhang, Shi-Chen, et al.
Pubblicazione: (2025)
di: Zhang, Shi-Chen, et al.
Pubblicazione: (2025)
DFormerv2: Geometry Self-Attention for RGBD Semantic Segmentation
di: Yin, Bo-Wen, et al.
Pubblicazione: (2025)
di: Yin, Bo-Wen, et al.
Pubblicazione: (2025)
A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2025)
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2025)
StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation
di: Zhou, Yupeng, et al.
Pubblicazione: (2024)
di: Zhou, Yupeng, et al.
Pubblicazione: (2024)
SM3Det: A Unified Model for Multi-Modal Remote Sensing Object Detection
di: Li, Yuxuan, et al.
Pubblicazione: (2024)
di: Li, Yuxuan, et al.
Pubblicazione: (2024)
AR-1-to-3: Single Image to Consistent 3D Object Generation via Next-View Prediction
di: Zhang, Xuying, et al.
Pubblicazione: (2025)
di: Zhang, Xuying, et al.
Pubblicazione: (2025)
GeoWorld: Unlocking the Potential of Geometry Models to Facilitate High-Fidelity 3D Scene Generation
di: Wan, Yuhao, et al.
Pubblicazione: (2025)
di: Wan, Yuhao, et al.
Pubblicazione: (2025)
Towards Stable 3D Object Detection
di: Wang, Jiabao, et al.
Pubblicazione: (2024)
di: Wang, Jiabao, et al.
Pubblicazione: (2024)
DreamStereo: Towards Real-Time Stereo Inpainting for HD Videos
di: Huang, Yuan, et al.
Pubblicazione: (2026)
di: Huang, Yuan, et al.
Pubblicazione: (2026)
Sora Generates Videos with Stunning Geometrical Consistency
di: Li, Xuanyi, et al.
Pubblicazione: (2024)
di: Li, Xuanyi, et al.
Pubblicazione: (2024)
OmniSegmentor: A Flexible Multi-Modal Learning Framework for Semantic Segmentation
di: Yin, Bo-Wen, et al.
Pubblicazione: (2025)
di: Yin, Bo-Wen, et al.
Pubblicazione: (2025)
SRFormerV2: Taking a Closer Look at Permuted Self-Attention for Image Super-Resolution
di: Zhou, Yupeng, et al.
Pubblicazione: (2023)
di: Zhou, Yupeng, et al.
Pubblicazione: (2023)
PR-MIM: Delving Deeper into Partial Reconstruction in Masked Image Modeling
di: Li, Zhong-Yu, et al.
Pubblicazione: (2024)
di: Li, Zhong-Yu, et al.
Pubblicazione: (2024)
MedQ-Bench: Evaluating and Exploring Medical Image Quality Assessment Abilities in MLLMs
di: Liu, Jiyao, et al.
Pubblicazione: (2025)
di: Liu, Jiyao, et al.
Pubblicazione: (2025)
MedSeg-R: Medical Image Segmentation with Clinical Reasoning
di: Shao, Hao, et al.
Pubblicazione: (2025)
di: Shao, Hao, et al.
Pubblicazione: (2025)
DFormer: Rethinking RGBD Representation Learning for Semantic Segmentation
di: Yin, Bowen, et al.
Pubblicazione: (2023)
di: Yin, Bowen, et al.
Pubblicazione: (2023)
Zone Evaluation: Revealing Spatial Bias in Object Detection
di: Zheng, Zhaohui, et al.
Pubblicazione: (2023)
di: Zheng, Zhaohui, et al.
Pubblicazione: (2023)
CrossKD: Cross-Head Knowledge Distillation for Object Detection
di: Wang, Jiabao, et al.
Pubblicazione: (2023)
di: Wang, Jiabao, et al.
Pubblicazione: (2023)
VideoAVE: A Multi-Attribute Video-to-Text Attribute Value Extraction Dataset and Benchmark Models
di: Cheng, Ming, et al.
Pubblicazione: (2025)
di: Cheng, Ming, et al.
Pubblicazione: (2025)
ControlSR: Taming Diffusion Models for Consistent Real-World Image Super Resolution
di: Wan, Yuhao, et al.
Pubblicazione: (2024)
di: Wan, Yuhao, et al.
Pubblicazione: (2024)
TAR3D: Creating High-Quality 3D Assets via Next-Part Prediction
di: Zhang, Xuying, et al.
Pubblicazione: (2024)
di: Zhang, Xuying, et al.
Pubblicazione: (2024)
LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding
di: Sun, Boyuan, et al.
Pubblicazione: (2025)
di: Sun, Boyuan, et al.
Pubblicazione: (2025)
OneVAE: Joint Discrete and Continuous Optimization Helps Discrete Video VAE Train Better
di: Zhou, Yupeng, et al.
Pubblicazione: (2025)
di: Zhou, Yupeng, et al.
Pubblicazione: (2025)
SARDet-100K: Towards Open-Source Benchmark and ToolKit for Large-Scale SAR Object Detection
di: Li, Yuxuan, et al.
Pubblicazione: (2024)
di: Li, Yuxuan, et al.
Pubblicazione: (2024)
KAC: Kolmogorov-Arnold Classifier for Continual Learning
di: Hu, Yusong, et al.
Pubblicazione: (2025)
di: Hu, Yusong, et al.
Pubblicazione: (2025)
Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining
di: Li, Yuxuan, et al.
Pubblicazione: (2026)
di: Li, Yuxuan, et al.
Pubblicazione: (2026)
Traffic Scene Parsing through the TSP6K Dataset
di: Jiang, Peng-Tao, et al.
Pubblicazione: (2023)
di: Jiang, Peng-Tao, et al.
Pubblicazione: (2023)
Referring Camouflaged Object Detection
di: Zhang, Xuying, et al.
Pubblicazione: (2023)
di: Zhang, Xuying, et al.
Pubblicazione: (2023)
VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking
di: Meng, Desen, et al.
Pubblicazione: (2025)
di: Meng, Desen, et al.
Pubblicazione: (2025)
MVQA: Mamba with Unified Sampling for Efficient Video Quality Assessment
di: Mi, Yachun, et al.
Pubblicazione: (2025)
di: Mi, Yachun, et al.
Pubblicazione: (2025)
YOLO-MS: Rethinking Multi-Scale Representation Learning for Real-time Object Detection
di: Chen, Yuming, et al.
Pubblicazione: (2023)
di: Chen, Yuming, et al.
Pubblicazione: (2023)
Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation
di: Zhou, Yupeng, et al.
Pubblicazione: (2026)
di: Zhou, Yupeng, et al.
Pubblicazione: (2026)
EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs
di: Dai, Yang, et al.
Pubblicazione: (2026)
di: Dai, Yang, et al.
Pubblicazione: (2026)
OPUS: Occupancy Prediction Using a Sparse Set
di: Wang, Jiabao, et al.
Pubblicazione: (2024)
di: Wang, Jiabao, et al.
Pubblicazione: (2024)
Rethinking RGB-D Salient Object Detection: Models, Data Sets, and Large-Scale Benchmarks
di: Fan, Deng-Ping, et al.
Pubblicazione: (2019)
di: Fan, Deng-Ping, et al.
Pubblicazione: (2019)
Documenti analoghi
-
TempSamp-R1: Effective Temporal Sampling with Reinforcement Fine-Tuning for Video LLMs
di: Li, Yunheng, et al.
Pubblicazione: (2025) -
Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought
di: Li, Yunheng, et al.
Pubblicazione: (2026) -
High-Quality Mask Tuning Matters for Open-Vocabulary Segmentation
di: Zeng, Quan-Sheng, et al.
Pubblicazione: (2024) -
Cascade-CLIP: Cascaded Vision-Language Embeddings Alignment for Zero-Shot Semantic Segmentation
di: Li, Yunheng, et al.
Pubblicazione: (2024) -
Unbiased Region-Language Alignment for Open-Vocabulary Dense Prediction
di: Li, Yunheng, et al.
Pubblicazione: (2024)