Enregistré dans:
| Auteurs principaux: | Gurbuz, A. Said, Hong, Sunghwan, Nassar, Ahmed, Pollefeys, Marc, Staar, Peter |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2602.14276 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models
par: Gröpl, Marcel, et autres
Publié: (2026)
par: Gröpl, Marcel, et autres
Publié: (2026)
TORA: Topological Representation Alignment for 3D Shape Assembly
par: Lee, Nahyuk, et autres
Publié: (2026)
par: Lee, Nahyuk, et autres
Publié: (2026)
Beyond Masks: The Case for Medical Image Parsing
par: Gupta, Siddharth, et autres
Publié: (2026)
par: Gupta, Siddharth, et autres
Publié: (2026)
ParseBench: A Document Parsing Benchmark for AI Agents
par: Zhang, Boyang, et autres
Publié: (2026)
par: Zhang, Boyang, et autres
Publié: (2026)
ParseCaps: An Interpretable Parsing Capsule Network for Medical Image Diagnosis
par: Geng, Xinyu, et autres
Publié: (2024)
par: Geng, Xinyu, et autres
Publié: (2024)
MarkushGrapher-2: End-to-end Multimodal Recognition of Chemical Structures
par: Strohmeyer, Tim, et autres
Publié: (2026)
par: Strohmeyer, Tim, et autres
Publié: (2026)
SmolDocling: An ultra-compact vision-language model for end-to-end multi-modal document conversion
par: Nassar, Ahmed, et autres
Publié: (2025)
par: Nassar, Ahmed, et autres
Publié: (2025)
Guideline2Graph: Profile-Aware Multimodal Parsing for Executable Clinical Decision Graphs
par: Kilic, Onur Selim, et autres
Publié: (2026)
par: Kilic, Onur Selim, et autres
Publié: (2026)
Reinforced Label Denoising for Weakly-Supervised Audio-Visual Video Parsing
par: Gao, Yongbiao, et autres
Publié: (2024)
par: Gao, Yongbiao, et autres
Publié: (2024)
Logics-Parsing Technical Report
par: Chen, Xiangyang, et autres
Publié: (2025)
par: Chen, Xiangyang, et autres
Publié: (2025)
Leveraging Multi-View Weak Supervision for Occlusion-Aware Multi-Human Parsing
par: Bragagnolo, Laura, et autres
Publié: (2025)
par: Bragagnolo, Laura, et autres
Publié: (2025)
MarkushGrapher: Joint Visual and Textual Recognition of Markush Structures
par: Morin, Lucas, et autres
Publié: (2025)
par: Morin, Lucas, et autres
Publié: (2025)
UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing
par: Zhang, Jiaxi, et autres
Publié: (2026)
par: Zhang, Jiaxi, et autres
Publié: (2026)
MolGrapher: Graph-based Visual Recognition of Chemical Structures
par: Morin, Lucas, et autres
Publié: (2023)
par: Morin, Lucas, et autres
Publié: (2023)
Intelligent Parsing: An Automated Parsing Framework for Extracting Design Semantics from E-commerce Creatives
par: Li, Guandong, et autres
Publié: (2023)
par: Li, Guandong, et autres
Publié: (2023)
Multimodal OCR: Parse Anything from Documents
par: Zheng, Handong, et autres
Publié: (2026)
par: Zheng, Handong, et autres
Publié: (2026)
PSGait: Gait Recognition using Parsing Skeleton
par: Xu, Hangrui, et autres
Publié: (2025)
par: Xu, Hangrui, et autres
Publié: (2025)
SCHNet: SAM Marries CLIP for Human Parsing
par: Liu, Kunliang, et autres
Publié: (2025)
par: Liu, Kunliang, et autres
Publié: (2025)
Explore Human Parsing Modality for Action Recognition
par: Liu, Jinfu, et autres
Publié: (2024)
par: Liu, Jinfu, et autres
Publié: (2024)
Learning AND-OR Templates for Professional Photograph Parsing and Guidance
par: Jin, Xin, et autres
Publié: (2024)
par: Jin, Xin, et autres
Publié: (2024)
DepthMatch: Semi-Supervised RGB-D Scene Parsing through Depth-Guided Regularization
par: Huang, Jianxin, et autres
Publié: (2025)
par: Huang, Jianxin, et autres
Publié: (2025)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
par: Li, Huilai, et autres
Publié: (2026)
par: Li, Huilai, et autres
Publié: (2026)
Teacher-Guided Pseudo Supervision and Cross-Modal Alignment for Audio-Visual Video Parsing
par: Chen, Yaru, et autres
Publié: (2025)
par: Chen, Yaru, et autres
Publié: (2025)
Occlusion-Aware Deep Convolutional Neural Network via Homogeneous Tanh-transforms for Face Parsing
par: Qiua, Jianhua, et autres
Publié: (2023)
par: Qiua, Jianhua, et autres
Publié: (2023)
DisFaceRep: Representation Disentanglement for Co-occurring Facial Components in Weakly Supervised Face Parsing
par: Wang, Xiaoqin, et autres
Publié: (2025)
par: Wang, Xiaoqin, et autres
Publié: (2025)
Unsupervised Collaborative Domain Adaptation for Driving Scene Parsing
par: Fan, Jiahe, et autres
Publié: (2026)
par: Fan, Jiahe, et autres
Publié: (2026)
Synthetically Trained Icon Proposals for Parsing and Summarizing Infographics
par: Madan, Spandan, et autres
Publié: (2018)
par: Madan, Spandan, et autres
Publié: (2018)
Parsing Objects at a Finer Granularity: A Survey
par: Zhao, Yifan, et autres
Publié: (2022)
par: Zhao, Yifan, et autres
Publié: (2022)
EasyPortrait -- Face Parsing and Portrait Segmentation Dataset
par: Kvanchiani, Karina, et autres
Publié: (2023)
par: Kvanchiani, Karina, et autres
Publié: (2023)
Dictionary-based Framework for Interpretable and Consistent Object Parsing
par: Zhang, Tiezheng, et autres
Publié: (2025)
par: Zhang, Tiezheng, et autres
Publié: (2025)
Graph-Boosted Attentive Network for Semantic Body Parsing
par: Wang, Tinghuai, et autres
Publié: (2024)
par: Wang, Tinghuai, et autres
Publié: (2024)
CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers
par: Chen, Weidong, et autres
Publié: (2026)
par: Chen, Weidong, et autres
Publié: (2026)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
par: Zhou, Jinxing, et autres
Publié: (2024)
par: Zhou, Jinxing, et autres
Publié: (2024)
SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing
par: Jing, Hongyi, et autres
Publié: (2025)
par: Jing, Hongyi, et autres
Publié: (2025)
CoLeaF: A Contrastive-Collaborative Learning Framework for Weakly Supervised Audio-Visual Video Parsing
par: Sardari, Faegheh, et autres
Publié: (2024)
par: Sardari, Faegheh, et autres
Publié: (2024)
Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting
par: Feng, Hao, et autres
Publié: (2026)
par: Feng, Hao, et autres
Publié: (2026)
Efficient Document Parsing via Parallel Token Prediction
par: Li, Lei, et autres
Publié: (2026)
par: Li, Lei, et autres
Publié: (2026)
SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding
par: Xu, Pengxin, et autres
Publié: (2026)
par: Xu, Pengxin, et autres
Publié: (2026)
Deep Learning Technique for Human Parsing: A Survey and Outlook
par: Yang, Lu, et autres
Publié: (2023)
par: Yang, Lu, et autres
Publié: (2023)
Traffic Scene Parsing through the TSP6K Dataset
par: Jiang, Peng-Tao, et autres
Publié: (2023)
par: Jiang, Peng-Tao, et autres
Publié: (2023)
Documents similaires
-
Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models
par: Gröpl, Marcel, et autres
Publié: (2026) -
TORA: Topological Representation Alignment for 3D Shape Assembly
par: Lee, Nahyuk, et autres
Publié: (2026) -
Beyond Masks: The Case for Medical Image Parsing
par: Gupta, Siddharth, et autres
Publié: (2026) -
ParseBench: A Document Parsing Benchmark for AI Agents
par: Zhang, Boyang, et autres
Publié: (2026) -
ParseCaps: An Interpretable Parsing Capsule Network for Medical Image Diagnosis
par: Geng, Xinyu, et autres
Publié: (2024)