XY-Cut++: Advanced Layout Ordering via Hierarchical Mask Mechanism on a Novel Benchmark
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Shuai, Li, Youmeng, Wei, Jizeng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Hierarchical Masked Autoregressive Models with Low-Resolution Token Pivots
par: Zheng, Guangting, et autres
Publié: (2025)
par: Zheng, Guangting, et autres
Publié: (2025)
QPT V2: Masked Image Modeling Advances Visual Scoring
par: Xie, Qizhi, et autres
Publié: (2024)
par: Xie, Qizhi, et autres
Publié: (2024)
Self-supervised Photographic Image Layout Representation Learning
par: Zhao, Zhaoran, et autres
Publié: (2024)
par: Zhao, Zhaoran, et autres
Publié: (2024)
MU-MAE: Multimodal Masked Autoencoders-Based One-Shot Learning
par: Liu, Rex, et autres
Publié: (2024)
par: Liu, Rex, et autres
Publié: (2024)
Learning Generalizable and Efficient Image Watermarking via Hierarchical Two-Stage Optimization
par: Liu, Ke, et autres
Publié: (2025)
par: Liu, Ke, et autres
Publié: (2025)
Scaling and Masking: A New Paradigm of Data Sampling for Image and Video Quality Assessment
par: Liu, Yongxu, et autres
Publié: (2024)
par: Liu, Yongxu, et autres
Publié: (2024)
MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation
par: Xu, Shuolin, et autres
Publié: (2025)
par: Xu, Shuolin, et autres
Publié: (2025)
FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing
par: Cai, Lingling, et autres
Publié: (2024)
par: Cai, Lingling, et autres
Publié: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
par: Zhang, Zhenxing, et autres
Publié: (2024)
par: Zhang, Zhenxing, et autres
Publié: (2024)
Single Image Dehazing Using Scene Depth Ordering
par: Ling, Pengyang, et autres
Publié: (2024)
par: Ling, Pengyang, et autres
Publié: (2024)
SEED: A Benchmark Dataset for Sequential Facial Attribute Editing with Diffusion Models
par: Zhu, Yule, et autres
Publié: (2025)
par: Zhu, Yule, et autres
Publié: (2025)
Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions
par: Zhang, Rui, et autres
Publié: (2024)
par: Zhang, Rui, et autres
Publié: (2024)
VC-Bench: Pioneering the Video Connecting Benchmark with a Dataset and Evaluation Metrics
par: Yin, Zhiyu, et autres
Publié: (2026)
par: Yin, Zhiyu, et autres
Publié: (2026)
PAME: Self-Supervised Masked Autoencoder for No-Reference Point Cloud Quality Assessment
par: Shan, Ziyu, et autres
Publié: (2024)
par: Shan, Ziyu, et autres
Publié: (2024)
AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards
par: Pan, Yiming, et autres
Publié: (2026)
par: Pan, Yiming, et autres
Publié: (2026)
SegTalker: Segmentation-based Talking Face Generation with Mask-guided Local Editing
par: Xiong, Lingyu, et autres
Publié: (2024)
par: Xiong, Lingyu, et autres
Publié: (2024)
Agent Journey Beyond RGB: Hierarchical Semantic-Spatial Representation Enrichment for Vision-and-Language Navigation
par: Zhang, Xuesong, et autres
Publié: (2024)
par: Zhang, Xuesong, et autres
Publié: (2024)
SmartFreeEdit: Mask-Free Spatial-Aware Image Editing with Complex Instruction Understanding
par: Sun, Qianqian, et autres
Publié: (2025)
par: Sun, Qianqian, et autres
Publié: (2025)
SMC++: Masked Learning of Unsupervised Video Semantic Compression
par: Tian, Yuan, et autres
Publié: (2024)
par: Tian, Yuan, et autres
Publié: (2024)
MSRS: Training Multimodal Speech Recognition Models from Scratch with Sparse Mask Optimization
par: Fernandez-Lopez, Adriana, et autres
Publié: (2024)
par: Fernandez-Lopez, Adriana, et autres
Publié: (2024)
When and How to Cut Classical Concerts? A Multimodal Automated Video Editing Approach
par: Gonzálbez-Biosca, Daniel, et autres
Publié: (2025)
par: Gonzálbez-Biosca, Daniel, et autres
Publié: (2025)
Hierarchical Sub-action Tree for Continuous Sign Language Recognition
par: Yang, Dejie, et autres
Publié: (2025)
par: Yang, Dejie, et autres
Publié: (2025)
Learning Brain Representation with Hierarchical Visual Embeddings
par: Zheng, Jiawen, et autres
Publié: (2026)
par: Zheng, Jiawen, et autres
Publié: (2026)
Generalizable Deepfake Detection Based on Forgery-aware Layer Masking and Multi-artifact Subspace Decomposition
par: Zhang, Xiang, et autres
Publié: (2026)
par: Zhang, Xiang, et autres
Publié: (2026)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
par: Meng, Yiran, et autres
Publié: (2025)
par: Meng, Yiran, et autres
Publié: (2025)
Probabilistic Temporal Masked Attention for Cross-view Online Action Detection
par: Xie, Liping, et autres
Publié: (2025)
par: Xie, Liping, et autres
Publié: (2025)
Retrieving Any Relevant Moments: Benchmark and Models for Generalized Moment Retrieval
par: Ding, Yiming, et autres
Publié: (2026)
par: Ding, Yiming, et autres
Publié: (2026)
A Novel Approach to Industrial Defect Generation through Blended Latent Diffusion Model with Online Adaptation
par: Li, Hanxi, et autres
Publié: (2024)
par: Li, Hanxi, et autres
Publié: (2024)
HUD: Hierarchical Uncertainty-Aware Disambiguation Network for Composed Video Retrieval
par: Chen, Zhiwei, et autres
Publié: (2025)
par: Chen, Zhiwei, et autres
Publié: (2025)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
Seeing Text in the Dark: Algorithm and Benchmark
par: Xu, Chengpei, et autres
Publié: (2024)
par: Xu, Chengpei, et autres
Publié: (2024)
Advancing Unsupervised Low-light Image Enhancement: Noise Estimation, Illumination Interpolation, and Self-Regulation
par: Liu, Xiaofeng, et autres
Publié: (2023)
par: Liu, Xiaofeng, et autres
Publié: (2023)
AdaptaGen: Domain-Specific Image Generation through Hierarchical Semantic Optimization Framework
par: Zhang, Suoxiang, et autres
Publié: (2025)
par: Zhang, Suoxiang, et autres
Publié: (2025)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
par: Chu, Meng, et autres
Publié: (2023)
par: Chu, Meng, et autres
Publié: (2023)
LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs
par: Xu, Zitong, et autres
Publié: (2025)
par: Xu, Zitong, et autres
Publié: (2025)
CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
par: Qiao, Xiangshuo, et autres
Publié: (2024)
par: Qiao, Xiangshuo, et autres
Publié: (2024)
Robust Modality-incomplete Anomaly Detection: A Modality-instructive Framework with Benchmark
par: Miao, Bingchen, et autres
Publié: (2024)
par: Miao, Bingchen, et autres
Publié: (2024)
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
par: Zhang, Peng-Fei, et autres
Publié: (2026)
par: Zhang, Peng-Fei, et autres
Publié: (2026)
Multiple Contexts and Frequencies Aggregation Network forDeepfake Detection
par: Li, Zifeng, et autres
Publié: (2024)
par: Li, Zifeng, et autres
Publié: (2024)
DT-UFC: Universal Large Model Feature Coding via Peaky-to-Balanced Distribution Transformation
par: Gao, Changsheng, et autres
Publié: (2025)
par: Gao, Changsheng, et autres
Publié: (2025)
Documents similaires
-
Hierarchical Masked Autoregressive Models with Low-Resolution Token Pivots
par: Zheng, Guangting, et autres
Publié: (2025) -
QPT V2: Masked Image Modeling Advances Visual Scoring
par: Xie, Qizhi, et autres
Publié: (2024) -
Self-supervised Photographic Image Layout Representation Learning
par: Zhao, Zhaoran, et autres
Publié: (2024) -
MU-MAE: Multimodal Masked Autoencoders-Based One-Shot Learning
par: Liu, Rex, et autres
Publié: (2024) -
Learning Generalizable and Efficient Image Watermarking via Hierarchical Two-Stage Optimization
par: Liu, Ke, et autres
Publié: (2025)