QPT V2: Masked Image Modeling Advances Visual Scoring
Fuente:
arXiv
Guardado en:
| Autores principales: | Xie, Qizhi, Yuan, Kun, Qu, Yunpeng, Wu, Mingda, Sun, Ming, Zhou, Chao, Zhu, Jihong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Score2Instruct: Scaling Up Video Quality-Centric Instructions via Automated Dimension Scoring
por: Xie, Qizhi, et al.
Publicado: (2025)
por: Xie, Qizhi, et al.
Publicado: (2025)
Pioneering Perceptual Video Fluency Assessment: A Novel Task with Benchmark Dataset and Baseline
por: Xie, Qizhi, et al.
Publicado: (2026)
por: Xie, Qizhi, et al.
Publicado: (2026)
Visual Autoregressive Modeling for Image Super-Resolution
por: Qu, Yunpeng, et al.
Publicado: (2025)
por: Qu, Yunpeng, et al.
Publicado: (2025)
TA-V2A: Textually Assisted Video-to-Audio Generation
por: You, Yuhuan, et al.
Publicado: (2025)
por: You, Yuhuan, et al.
Publicado: (2025)
SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding
por: Sun, Qianqian, et al.
Publicado: (2025)
por: Sun, Qianqian, et al.
Publicado: (2025)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
por: Cai, Lingling, et al.
Publicado: (2024)
por: Cai, Lingling, et al.
Publicado: (2024)
Scaling and Masking: A New Paradigm of Data Sampling for Image and Video Quality Assessment
por: Liu, Yongxu, et al.
Publicado: (2024)
por: Liu, Yongxu, et al.
Publicado: (2024)
WVSC: Wireless Video Semantic Communication with Multi-frame Compensation
por: Xie, Bingyan, et al.
Publicado: (2025)
por: Xie, Bingyan, et al.
Publicado: (2025)
XPSR: Cross-modal Priors for Diffusion-based Image Super-Resolution
por: Qu, Yunpeng, et al.
Publicado: (2024)
por: Qu, Yunpeng, et al.
Publicado: (2024)
KVQ: Boosting Video Quality Assessment via Saliency-guided Local Perception
por: Qu, Yunpeng, et al.
Publicado: (2025)
por: Qu, Yunpeng, et al.
Publicado: (2025)
XY-Cut++: Advanced Layout Ordering via Hierarchical Mask Mechanism on a Novel Benchmark
por: Liu, Shuai, et al.
Publicado: (2025)
por: Liu, Shuai, et al.
Publicado: (2025)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
por: Zhou, Jinxing, et al.
Publicado: (2024)
por: Zhou, Jinxing, et al.
Publicado: (2024)
Visual Autoregressive Modeling for Instruction-Guided Image Editing
por: Mao, Qingyang, et al.
Publicado: (2025)
por: Mao, Qingyang, et al.
Publicado: (2025)
SMC++: Masked Learning of Unsupervised Video Semantic Compression
por: Tian, Yuan, et al.
Publicado: (2024)
por: Tian, Yuan, et al.
Publicado: (2024)
Probabilistic Temporal Masked Attention for Cross-view Online Action Detection
por: Xie, Liping, et al.
Publicado: (2025)
por: Xie, Liping, et al.
Publicado: (2025)
Patch-level Sounding Object Tracking for Audio-Visual Question Answering
por: Li, Zhangbin, et al.
Publicado: (2024)
por: Li, Zhangbin, et al.
Publicado: (2024)
Causal Debiasing for Visual Commonsense Reasoning
por: Zou, Jiayi, et al.
Publicado: (2025)
por: Zou, Jiayi, et al.
Publicado: (2025)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
por: Hao, Bowen, et al.
Publicado: (2025)
por: Hao, Bowen, et al.
Publicado: (2025)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
por: Zhang, Zhenxing, et al.
Publicado: (2024)
por: Zhang, Zhenxing, et al.
Publicado: (2024)
JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation
por: Chao, Jianghan, et al.
Publicado: (2025)
por: Chao, Jianghan, et al.
Publicado: (2025)
One Framework to Rule Them All: Unifying Multimodal Tasks with LLM Neural-Tuning
por: Sun, Hao, et al.
Publicado: (2024)
por: Sun, Hao, et al.
Publicado: (2024)
SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local Editing
por: Xiong, Lingyu, et al.
Publicado: (2024)
por: Xiong, Lingyu, et al.
Publicado: (2024)
VAAS: Vision-Attention Anomaly Scoring for Image Manipulation Detection in Digital Forensics
por: Bamigbade, Opeyemi, et al.
Publicado: (2025)
por: Bamigbade, Opeyemi, et al.
Publicado: (2025)
Hierarchical Masked Autoregressive Models with Low-Resolution Token Pivots
por: Zheng, Guangting, et al.
Publicado: (2025)
por: Zheng, Guangting, et al.
Publicado: (2025)
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing
por: Chen, Liyang, et al.
Publicado: (2025)
por: Chen, Liyang, et al.
Publicado: (2025)
Progressive Confident Masking Attention Network for Audio-Visual Segmentation
por: Wang, Yuxuan, et al.
Publicado: (2024)
por: Wang, Yuxuan, et al.
Publicado: (2024)
Incorporating Visual Experts to Resolve the Information Loss in Multimodal Large Language Models
por: He, Xin, et al.
Publicado: (2024)
por: He, Xin, et al.
Publicado: (2024)
Wills Aligner: Multi-Subject Collaborative Brain Visual Decoding
por: Bao, Guangyin, et al.
Publicado: (2024)
por: Bao, Guangyin, et al.
Publicado: (2024)
Bringing Textual Prompt to AI-Generated Image Quality Assessment
por: Qu, Bowen, et al.
Publicado: (2024)
por: Qu, Bowen, et al.
Publicado: (2024)
SonoWorld: From One Image to a 3D Audio-Visual Scene
por: Jin, Derong, et al.
Publicado: (2026)
por: Jin, Derong, et al.
Publicado: (2026)
Synthetic Perception: Can Generated Images Unlock Latent Visual Prior for Text-Centric Reasoning?
por: Huang, Yuesheng, et al.
Publicado: (2025)
por: Huang, Yuesheng, et al.
Publicado: (2025)
Class Agnostic Instance-level Descriptor for Visual Instance Search
por: Sun, Qi-Ying, et al.
Publicado: (2025)
por: Sun, Qi-Ying, et al.
Publicado: (2025)
EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation
por: Qu, Qiang, et al.
Publicado: (2025)
por: Qu, Qiang, et al.
Publicado: (2025)
TextRefiner: Internal Visual Feature as Efficient Refiner for Vision-Language Models Prompt Tuning
por: Xie, Jingjing, et al.
Publicado: (2024)
por: Xie, Jingjing, et al.
Publicado: (2024)
Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation
por: Wu, Yi, et al.
Publicado: (2025)
por: Wu, Yi, et al.
Publicado: (2025)
MSRS: Training Multimodal Speech Recognition Models from Scratch with Sparse Mask Optimization
por: Fernandez-Lopez, Adriana, et al.
Publicado: (2024)
por: Fernandez-Lopez, Adriana, et al.
Publicado: (2024)
TR-DETR: Task-Reciprocal Transformer for Joint Moment Retrieval and Highlight Detection
por: Sun, Hao, et al.
Publicado: (2024)
por: Sun, Hao, et al.
Publicado: (2024)
ChatVTG: Video Temporal Grounding via Chat with Video Dialogue Large Language Models
por: Qu, Mengxue, et al.
Publicado: (2024)
por: Qu, Mengxue, et al.
Publicado: (2024)
Learning to Mask and Permute Visual Tokens for Vision Transformer Pre-Training
por: Baraldi, Lorenzo, et al.
Publicado: (2023)
por: Baraldi, Lorenzo, et al.
Publicado: (2023)
MISS: Memory-efficient Instance Segmentation Framework By Visual Inductive Priors Flow Propagation
por: Hsu, Chih-Chung, et al.
Publicado: (2024)
por: Hsu, Chih-Chung, et al.
Publicado: (2024)
Ejemplares similares
-
Score2Instruct: Scaling Up Video Quality-Centric Instructions via Automated Dimension Scoring
por: Xie, Qizhi, et al.
Publicado: (2025) -
Pioneering Perceptual Video Fluency Assessment: A Novel Task with Benchmark Dataset and Baseline
por: Xie, Qizhi, et al.
Publicado: (2026) -
Visual Autoregressive Modeling for Image Super-Resolution
por: Qu, Yunpeng, et al.
Publicado: (2025) -
TA-V2A: Textually Assisted Video-to-Audio Generation
por: You, Yuhuan, et al.
Publicado: (2025) -
SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding
por: Sun, Qianqian, et al.
Publicado: (2025)