PartGLEE: A Foundation Model for Recognizing and Parsing Any Objects
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Junyi, Wu, Junfeng, Zhao, Weizhi, Bai, Song, Bai, Xiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
AnimateAnyMesh++: A Flexible 4D Foundation Model for High-Fidelity Text-Driven Mesh Animation
von: Wu, Zijie, et al.
Veröffentlicht: (2026)
von: Wu, Zijie, et al.
Veröffentlicht: (2026)
AnimateAnyMesh: A Feed-Forward 4D Foundation Model for Text-Driven Universal Mesh Animation
von: Wu, Zijie, et al.
Veröffentlicht: (2025)
von: Wu, Zijie, et al.
Veröffentlicht: (2025)
TokBench: Evaluating Your Visual Tokenizer before Visual Generation
von: Wu, Junfeng, et al.
Veröffentlicht: (2025)
von: Wu, Junfeng, et al.
Veröffentlicht: (2025)
Recognize Any Surgical Object: Unleashing the Power of Weakly-Supervised Data
von: Li, Jiajie, et al.
Veröffentlicht: (2025)
von: Li, Jiajie, et al.
Veröffentlicht: (2025)
Liquid: Language Models are Scalable and Unified Multi-modal Generators
von: Wu, Junfeng, et al.
Veröffentlicht: (2024)
von: Wu, Junfeng, et al.
Veröffentlicht: (2024)
Recognize Any Regions
von: Yang, Haosen, et al.
Veröffentlicht: (2023)
von: Yang, Haosen, et al.
Veröffentlicht: (2023)
Parsing Objects at a Finer Granularity: A Survey
von: Zhao, Yifan, et al.
Veröffentlicht: (2022)
von: Zhao, Yifan, et al.
Veröffentlicht: (2022)
Adaptive Articulated Object Manipulation On The Fly with Foundation Model Reasoning and Part Grounding
von: Zhang, Xiaojie, et al.
Veröffentlicht: (2025)
von: Zhang, Xiaojie, et al.
Veröffentlicht: (2025)
SAMPart3D: Segment Any Part in 3D Objects
von: Yang, Yunhan, et al.
Veröffentlicht: (2024)
von: Yang, Yunhan, et al.
Veröffentlicht: (2024)
Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation
von: Lin, Xin, et al.
Veröffentlicht: (2025)
von: Lin, Xin, et al.
Veröffentlicht: (2025)
PartCraft: Crafting Creative Objects by Parts
von: Ng, Kam Woh, et al.
Veröffentlicht: (2024)
von: Ng, Kam Woh, et al.
Veröffentlicht: (2024)
Anything in Any Scene: Photorealistic Video Object Insertion
von: Bai, Chen, et al.
Veröffentlicht: (2024)
von: Bai, Chen, et al.
Veröffentlicht: (2024)
CIV-DG: Conditional Instrumental Variables for Domain Generalization in Medical Imaging
von: Bai, Shaojin, et al.
Veröffentlicht: (2026)
von: Bai, Shaojin, et al.
Veröffentlicht: (2026)
Any-Optical-Model: A Universal Foundation Model for Optical Remote Sensing
von: Li, Xuyang, et al.
Veröffentlicht: (2025)
von: Li, Xuyang, et al.
Veröffentlicht: (2025)
Learning to Efficiently Adapt Foundation Models for Self-Supervised Endoscopic 3D Scene Reconstruction from Any Cameras
von: Cui, Beilei, et al.
Veröffentlicht: (2025)
von: Cui, Beilei, et al.
Veröffentlicht: (2025)
OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models
von: Yu, Wenwen, et al.
Veröffentlicht: (2025)
von: Yu, Wenwen, et al.
Veröffentlicht: (2025)
MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
von: Li, Zhang, et al.
Veröffentlicht: (2026)
von: Li, Zhang, et al.
Veröffentlicht: (2026)
Single-Model and Any-Modality for Video Object Tracking
von: Wu, Zongwei, et al.
Veröffentlicht: (2023)
von: Wu, Zongwei, et al.
Veröffentlicht: (2023)
FoundationSLAM: Unleashing the Power of Depth Foundation Models for End-to-End Dense Visual SLAM
von: Wu, Yuchen, et al.
Veröffentlicht: (2025)
von: Wu, Yuchen, et al.
Veröffentlicht: (2025)
Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval
von: Wang, Zhichuan, et al.
Veröffentlicht: (2025)
von: Wang, Zhichuan, et al.
Veröffentlicht: (2025)
EndoDAC: Efficient Adapting Foundation Model for Self-Supervised Depth Estimation from Any Endoscopic Camera
von: Cui, Beilei, et al.
Veröffentlicht: (2024)
von: Cui, Beilei, et al.
Veröffentlicht: (2024)
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
von: Li, Zhang, et al.
Veröffentlicht: (2025)
von: Li, Zhang, et al.
Veröffentlicht: (2025)
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
von: Chen, Jinshu, et al.
Veröffentlicht: (2025)
von: Chen, Jinshu, et al.
Veröffentlicht: (2025)
AnyDoor: Zero-shot Object-level Image Customization
von: Chen, Xi, et al.
Veröffentlicht: (2023)
von: Chen, Xi, et al.
Veröffentlicht: (2023)
Any-to-All MRI Synthesis: A Unified Foundation Model for Nasopharyngeal Carcinoma and Its Downstream Applications
von: Pu, Yao, et al.
Veröffentlicht: (2026)
von: Pu, Yao, et al.
Veröffentlicht: (2026)
One2Any: One-Reference 6D Pose Estimation for Any Object
von: Liu, Mengya, et al.
Veröffentlicht: (2025)
von: Liu, Mengya, et al.
Veröffentlicht: (2025)
Find Any Part in 3D
von: Ma, Ziqi, et al.
Veröffentlicht: (2024)
von: Ma, Ziqi, et al.
Veröffentlicht: (2024)
Multimodal OCR: Parse Anything from Documents
von: Zheng, Handong, et al.
Veröffentlicht: (2026)
von: Zheng, Handong, et al.
Veröffentlicht: (2026)
VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control
von: Tu, Yuanpeng, et al.
Veröffentlicht: (2025)
von: Tu, Yuanpeng, et al.
Veröffentlicht: (2025)
Dictionary-based Framework for Interpretable and Consistent Object Parsing
von: Zhang, Tiezheng, et al.
Veröffentlicht: (2025)
von: Zhang, Tiezheng, et al.
Veröffentlicht: (2025)
MDReID: Modality-Decoupled Learning for Any-to-Any Multi-Modal Object Re-Identification
von: Feng, Yingying, et al.
Veröffentlicht: (2025)
von: Feng, Yingying, et al.
Veröffentlicht: (2025)
Adaptive Noise-Tolerant Network for Image Segmentation
von: Li, Weizhi
Veröffentlicht: (2025)
von: Li, Weizhi
Veröffentlicht: (2025)
LabelAny3D: Label Any Object 3D in the Wild
von: Yao, Jin, et al.
Veröffentlicht: (2026)
von: Yao, Jin, et al.
Veröffentlicht: (2026)
P$^2$HCT: Plug-and-Play Hierarchical C2F Transformer for Multi-Scale Feature Fusion
von: Hu, Junyi, et al.
Veröffentlicht: (2025)
von: Hu, Junyi, et al.
Veröffentlicht: (2025)
Recognizing Unseen States of Unknown Objects by Leveraging Knowledge Graphs
von: Gouidis, Filipos, et al.
Veröffentlicht: (2023)
von: Gouidis, Filipos, et al.
Veröffentlicht: (2023)
A Survey on Computational Solutions for Reconstructing Complete Objects by Reassembling Their Fractured Parts
von: Lu, Jiaxin, et al.
Veröffentlicht: (2024)
von: Lu, Jiaxin, et al.
Veröffentlicht: (2024)
Virtual Full-stack Scanning of Brain MRI via Imputing Any Quantised Code
von: Wu, Yicheng, et al.
Veröffentlicht: (2025)
von: Wu, Yicheng, et al.
Veröffentlicht: (2025)
Entropy Reveals Block Importance in Masked Self-Supervised Vision Transformers
von: Xiang, Peihao, et al.
Veröffentlicht: (2026)
von: Xiang, Peihao, et al.
Veröffentlicht: (2026)
Interaction-aware Representation Modeling with Co-occurrence Consistency for Egocentric Hand-Object Parsing
von: Su, Yuejiao, et al.
Veröffentlicht: (2026)
von: Su, Yuejiao, et al.
Veröffentlicht: (2026)
ExpAlign: Expectation-Guided Vision-Language Alignment for Open-Vocabulary Grounding
von: Hu, Junyi, et al.
Veröffentlicht: (2026)
von: Hu, Junyi, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
AnimateAnyMesh++: A Flexible 4D Foundation Model for High-Fidelity Text-Driven Mesh Animation
von: Wu, Zijie, et al.
Veröffentlicht: (2026) -
AnimateAnyMesh: A Feed-Forward 4D Foundation Model for Text-Driven Universal Mesh Animation
von: Wu, Zijie, et al.
Veröffentlicht: (2025) -
TokBench: Evaluating Your Visual Tokenizer before Visual Generation
von: Wu, Junfeng, et al.
Veröffentlicht: (2025) -
Recognize Any Surgical Object: Unleashing the Power of Weakly-Supervised Data
von: Li, Jiajie, et al.
Veröffentlicht: (2025) -
Liquid: Language Models are Scalable and Unified Multi-modal Generators
von: Wu, Junfeng, et al.
Veröffentlicht: (2024)