Learning AND-OR Templates for Professional Photograph Parsing and Guidance
Fuente:
arXiv
Salvato in:
| Autori principali: | Jin, Xin, Zhang, Liaoruxing, Fan, Chenyu, Yuan, Wenbo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
PIG: Prompt Images Guidance for Night-Time Scene Parsing
di: Xie, Zhifeng, et al.
Pubblicazione: (2024)
di: Xie, Zhifeng, et al.
Pubblicazione: (2024)
DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation
di: Du, Yongkun, et al.
Pubblicazione: (2025)
di: Du, Yongkun, et al.
Pubblicazione: (2025)
Clutter Detection and Removal by Multi-Objective Analysis for Photographic Guidance
di: Wu, Xiaoran
Pubblicazione: (2025)
di: Wu, Xiaoran
Pubblicazione: (2025)
Unsupervised Collaborative Domain Adaptation for Driving Scene Parsing
di: Fan, Jiahe, et al.
Pubblicazione: (2026)
di: Fan, Jiahe, et al.
Pubblicazione: (2026)
UniParser: Multi-Human Parsing with Unified Correlation Representation Learning
di: Chu, Jiaming, et al.
Pubblicazione: (2023)
di: Chu, Jiaming, et al.
Pubblicazione: (2023)
MC$^2$: Multi-concept Guidance for Customized Multi-concept Generation
di: Jiang, Jiaxiu, et al.
Pubblicazione: (2024)
di: Jiang, Jiaxiu, et al.
Pubblicazione: (2024)
The Photographer Eye: Teaching Multimodal Large Language Models to Understand Image Aesthetics like Photographers
di: Qi, Daiqing, et al.
Pubblicazione: (2025)
di: Qi, Daiqing, et al.
Pubblicazione: (2025)
ParseBench: A Document Parsing Benchmark for AI Agents
di: Zhang, Boyang, et al.
Pubblicazione: (2026)
di: Zhang, Boyang, et al.
Pubblicazione: (2026)
Learning Where to Focus: Density-Driven Guidance for Detecting Dense Tiny Objects
di: Zhao, Zhicheng, et al.
Pubblicazione: (2025)
di: Zhao, Zhicheng, et al.
Pubblicazione: (2025)
Logics-Parsing Technical Report
di: Chen, Xiangyang, et al.
Pubblicazione: (2025)
di: Chen, Xiangyang, et al.
Pubblicazione: (2025)
Rethinking Guidance Information to Utilize Unlabeled Samples:A Label Encoding Perspective
di: Zhang, Yulong, et al.
Pubblicazione: (2024)
di: Zhang, Yulong, et al.
Pubblicazione: (2024)
SCHNet: SAM Marries CLIP for Human Parsing
di: Liu, Kunliang, et al.
Pubblicazione: (2025)
di: Liu, Kunliang, et al.
Pubblicazione: (2025)
Efficient Multi-Instance Generation with Janus-Pro-Dirven Prompt Parsing
di: Qi, Fan, et al.
Pubblicazione: (2025)
di: Qi, Fan, et al.
Pubblicazione: (2025)
Multimodal OCR: Parse Anything from Documents
di: Zheng, Handong, et al.
Pubblicazione: (2026)
di: Zheng, Handong, et al.
Pubblicazione: (2026)
Videogenic: Identifying Highlight Moments in Videos with Professional Photographs as a Prior
di: Lin, David Chuan-En, et al.
Pubblicazione: (2022)
di: Lin, David Chuan-En, et al.
Pubblicazione: (2022)
ParseCaps: An Interpretable Parsing Capsule Network for Medical Image Diagnosis
di: Geng, Xinyu, et al.
Pubblicazione: (2024)
di: Geng, Xinyu, et al.
Pubblicazione: (2024)
DOCR-Inspector: Fine-Grained and Automated Evaluation of Document Parsing with VLM
di: Zhang, Qintong, et al.
Pubblicazione: (2025)
di: Zhang, Qintong, et al.
Pubblicazione: (2025)
ScreenParse: Moving Beyond Sparse Grounding with Complete Screen Parsing Supervision
di: Gurbuz, A. Said, et al.
Pubblicazione: (2026)
di: Gurbuz, A. Said, et al.
Pubblicazione: (2026)
Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model
di: Wang, Shijian, et al.
Pubblicazione: (2024)
di: Wang, Shijian, et al.
Pubblicazione: (2024)
ResMaster: Mastering High-Resolution Image Generation via Structural and Fine-Grained Guidance
di: Shi, Shuwei, et al.
Pubblicazione: (2024)
di: Shi, Shuwei, et al.
Pubblicazione: (2024)
Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance
di: Wang, Chenyu, et al.
Pubblicazione: (2026)
di: Wang, Chenyu, et al.
Pubblicazione: (2026)
Deep Learning Technique for Human Parsing: A Survey and Outlook
di: Yang, Lu, et al.
Pubblicazione: (2023)
di: Yang, Lu, et al.
Pubblicazione: (2023)
FaceCloak: Learning to Protect Face Templates
di: Banerjee, Sudipta, et al.
Pubblicazione: (2025)
di: Banerjee, Sudipta, et al.
Pubblicazione: (2025)
Multi-modal Mutual-Guidance Conditional Prompt Learning for Vision-Language Models
di: Yang, Shijun, et al.
Pubblicazione: (2025)
di: Yang, Shijun, et al.
Pubblicazione: (2025)
PSGait: Gait Recognition using Parsing Skeleton
di: Xu, Hangrui, et al.
Pubblicazione: (2025)
di: Xu, Hangrui, et al.
Pubblicazione: (2025)
Deep Light Pollution Removal in Night Cityscape Photographs
di: Wang, Hao, et al.
Pubblicazione: (2026)
di: Wang, Hao, et al.
Pubblicazione: (2026)
MeDocVL: A Visual Language Model for Medical Document Understanding and Parsing
di: Wang, Wenjie, et al.
Pubblicazione: (2026)
di: Wang, Wenjie, et al.
Pubblicazione: (2026)
Dictionary-based Framework for Interpretable and Consistent Object Parsing
di: Zhang, Tiezheng, et al.
Pubblicazione: (2025)
di: Zhang, Tiezheng, et al.
Pubblicazione: (2025)
Single-stage Multi-human Parsing via Point Sets and Center-based Offsets
di: Chu, Jiaming, et al.
Pubblicazione: (2023)
di: Chu, Jiaming, et al.
Pubblicazione: (2023)
PVLM: Parsing-Aware Vision Language Model with Dynamic Contrastive Learning for Zero-Shot Deepfake Attribution
di: Zhang, Yaning, et al.
Pubblicazione: (2025)
di: Zhang, Yaning, et al.
Pubblicazione: (2025)
Self-supervised Photographic Image Layout Representation Learning
di: Zhao, Zhaoran, et al.
Pubblicazione: (2024)
di: Zhao, Zhaoran, et al.
Pubblicazione: (2024)
RoadFormer: Duplex Transformer for RGB-Normal Semantic Road Scene Parsing
di: Li, Jiahang, et al.
Pubblicazione: (2023)
di: Li, Jiahang, et al.
Pubblicazione: (2023)
Personalized Image Filter: Mastering Your Photographic Style
di: Zhu, Chengxuan, et al.
Pubblicazione: (2025)
di: Zhu, Chengxuan, et al.
Pubblicazione: (2025)
Synthesizing Environment-Specific People in Photographs
di: Ostrek, Mirela, et al.
Pubblicazione: (2023)
di: Ostrek, Mirela, et al.
Pubblicazione: (2023)
PreFM: Online Audio-Visual Event Parsing via Predictive Future Modeling
di: Yu, Xiao, et al.
Pubblicazione: (2025)
di: Yu, Xiao, et al.
Pubblicazione: (2025)
Adaptive Guidance Learning for Camouflaged Object Detection
di: Chen, Zhennan, et al.
Pubblicazione: (2024)
di: Chen, Zhennan, et al.
Pubblicazione: (2024)
SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding
di: Xu, Pengxin, et al.
Pubblicazione: (2026)
di: Xu, Pengxin, et al.
Pubblicazione: (2026)
DepthMatch: Semi-Supervised RGB-D Scene Parsing through Depth-Guided Regularization
di: Huang, Jianxin, et al.
Pubblicazione: (2025)
di: Huang, Jianxin, et al.
Pubblicazione: (2025)
ICG-MVSNet: Learning Intra-view and Cross-view Relationships for Guidance in Multi-View Stereo
di: Hu, Yuxi, et al.
Pubblicazione: (2025)
di: Hu, Yuxi, et al.
Pubblicazione: (2025)
Efficient Document Parsing via Parallel Token Prediction
di: Li, Lei, et al.
Pubblicazione: (2026)
di: Li, Lei, et al.
Pubblicazione: (2026)
Documenti analoghi
-
PIG: Prompt Images Guidance for Night-Time Scene Parsing
di: Xie, Zhifeng, et al.
Pubblicazione: (2024) -
DocPTBench: Benchmarking End-to-End Photographed Document Parsing and Translation
di: Du, Yongkun, et al.
Pubblicazione: (2025) -
Clutter Detection and Removal by Multi-Objective Analysis for Photographic Guidance
di: Wu, Xiaoran
Pubblicazione: (2025) -
Unsupervised Collaborative Domain Adaptation for Driving Scene Parsing
di: Fan, Jiahe, et al.
Pubblicazione: (2026) -
UniParser: Multi-Human Parsing with Unified Correlation Representation Learning
di: Chu, Jiaming, et al.
Pubblicazione: (2023)