Training-Free Semantic Segmentation via LLM-Supervision
Fuente:
arXiv
Salvato in:
| Autori principali: | Sun, Wenfang, Du, Yingjun, Liu, Gaowen, Kompella, Ramana, Snoek, Cees G. M. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prompt Diffusion Robustifies Any-Modality Prompt Learning
di: Du, Yingjun, et al.
Pubblicazione: (2024)
di: Du, Yingjun, et al.
Pubblicazione: (2024)
QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain
di: Sun, Wenfang, et al.
Pubblicazione: (2024)
di: Sun, Wenfang, et al.
Pubblicazione: (2024)
IPO: Interpretable Prompt Optimization for Vision-Language Models
di: Du, Yingjun, et al.
Pubblicazione: (2024)
di: Du, Yingjun, et al.
Pubblicazione: (2024)
RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
di: Sun, Wenfang, et al.
Pubblicazione: (2026)
di: Sun, Wenfang, et al.
Pubblicazione: (2026)
SuperDisco: Super-Class Discovery Improves Visual Recognition for the Long-Tail
di: Du, Yingjun, et al.
Pubblicazione: (2023)
di: Du, Yingjun, et al.
Pubblicazione: (2023)
Efficient Multitask Dense Predictor via Binarization
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
di: Shang, Yuzhang, et al.
Pubblicazione: (2024)
Urban Scene Diffusion through Semantic Occupancy Map
di: Zhang, Junge, et al.
Pubblicazione: (2024)
di: Zhang, Junge, et al.
Pubblicazione: (2024)
Targeted Forgetting of Image Subgroups in CLIP Models
di: Zhang, Zeliang, et al.
Pubblicazione: (2025)
di: Zhang, Zeliang, et al.
Pubblicazione: (2025)
Motion Marionette: Rethinking Rigid Motion Transfer via Prior Guidance
di: Wang, Haoxuan, et al.
Pubblicazione: (2025)
di: Wang, Haoxuan, et al.
Pubblicazione: (2025)
Dual Guidance Semi-Supervised Action Detection
di: Singh, Ankit, et al.
Pubblicazione: (2025)
di: Singh, Ankit, et al.
Pubblicazione: (2025)
Orientation-anchored Hyper-Gaussian for 4D Reconstruction from Casual Videos
di: Wu, Junyi, et al.
Pubblicazione: (2025)
di: Wu, Junyi, et al.
Pubblicazione: (2025)
SimPLR: A Simple and Plain Transformer for Efficient Object Detection and Segmentation
di: Nguyen, Duy-Kien, et al.
Pubblicazione: (2023)
di: Nguyen, Duy-Kien, et al.
Pubblicazione: (2023)
Segment Any 3D-Part in a Scene from a Sentence
di: Wu, Hongyu, et al.
Pubblicazione: (2025)
di: Wu, Hongyu, et al.
Pubblicazione: (2025)
SwiftNDC: Fast Neural Depth Correction for High-Fidelity 3D Reconstruction
di: Han, Kang, et al.
Pubblicazione: (2026)
di: Han, Kang, et al.
Pubblicazione: (2026)
TWIST & SCOUT: Grounding Multimodal LLM-Experts by Forget-Free Tuning
di: Bhowmik, Aritra, et al.
Pubblicazione: (2024)
di: Bhowmik, Aritra, et al.
Pubblicazione: (2024)
Low-Resource Vision Challenges for Foundation Models
di: Zhang, Yunhua, et al.
Pubblicazione: (2024)
di: Zhang, Yunhua, et al.
Pubblicazione: (2024)
GIFSplat: Generative Prior-Guided Iterative Feed-Forward 3D Gaussian Splatting from Sparse Views
di: Chen, Tianyu, et al.
Pubblicazione: (2026)
di: Chen, Tianyu, et al.
Pubblicazione: (2026)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
di: Liu, Huabin, et al.
Pubblicazione: (2025)
di: Liu, Huabin, et al.
Pubblicazione: (2025)
MoSiC: Optimal-Transport Motion Trajectory for Dense Self-Supervised Learning
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2025)
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2025)
Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2026)
di: Tekin, Selim Furkan, et al.
Pubblicazione: (2026)
A Neurosymbolic Agent System for Compositional Visual Reasoning
di: Xu, Yichang, et al.
Pubblicazione: (2025)
di: Xu, Yichang, et al.
Pubblicazione: (2025)
PIN: Positional Insert Unlocks Object Localisation Abilities in VLMs
di: Dorkenwald, Michael, et al.
Pubblicazione: (2024)
di: Dorkenwald, Michael, et al.
Pubblicazione: (2024)
CaPo: Cooperative Plan Optimization for Efficient Embodied Multi-Agent Cooperation
di: Liu, Jie, et al.
Pubblicazione: (2024)
di: Liu, Jie, et al.
Pubblicazione: (2024)
LocoMotion: Learning Motion-Focused Video-Language Representations
di: Doughty, Hazel, et al.
Pubblicazione: (2024)
di: Doughty, Hazel, et al.
Pubblicazione: (2024)
ModuSeg: Decoupling Object Discovery and Semantic Retrieval for Training-Free Weakly Supervised Segmentation
di: He, Qingze, et al.
Pubblicazione: (2026)
di: He, Qingze, et al.
Pubblicazione: (2026)
Spectrally Distilled Representations Aligned with Instruction-Augmented LLMs for Satellite Imagery
di: Do, Minh Kha, et al.
Pubblicazione: (2026)
di: Do, Minh Kha, et al.
Pubblicazione: (2026)
MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
di: Bhowmik, Aritra, et al.
Pubblicazione: (2025)
Beyond Coarse-Grained Matching in Video-Text Retrieval
di: Chen, Aozhu, et al.
Pubblicazione: (2024)
di: Chen, Aozhu, et al.
Pubblicazione: (2024)
Attention-aware Inference Optimizations for Large Vision-Language Models with Memory-efficient Decoding
di: Ilhan, Fatih, et al.
Pubblicazione: (2026)
di: Ilhan, Fatih, et al.
Pubblicazione: (2026)
Redefining Normal: A Novel Object-Level Approach for Multi-Object Novelty Detection
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
di: Salehi, Mohammadreza, et al.
Pubblicazione: (2024)
Lost in Time: A New Temporal Benchmark for VideoLLMs
di: Cores, Daniel, et al.
Pubblicazione: (2024)
di: Cores, Daniel, et al.
Pubblicazione: (2024)
Elastic ViTs from Pretrained Models without Retraining
di: Simoncini, Walter, et al.
Pubblicazione: (2025)
di: Simoncini, Walter, et al.
Pubblicazione: (2025)
UnlearnCanvas: Stylized Image Dataset for Enhanced Machine Unlearning Evaluation in Diffusion Models
di: Zhang, Yihua, et al.
Pubblicazione: (2024)
di: Zhang, Yihua, et al.
Pubblicazione: (2024)
Any-Shift Prompting for Generalization over Distributions
di: Xiao, Zehao, et al.
Pubblicazione: (2024)
di: Xiao, Zehao, et al.
Pubblicazione: (2024)
Union-over-Intersections: Object Detection beyond Winner-Takes-All
di: Bhowmik, Aritra, et al.
Pubblicazione: (2023)
di: Bhowmik, Aritra, et al.
Pubblicazione: (2023)
A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning
di: Xu, Yichang, et al.
Pubblicazione: (2026)
di: Xu, Yichang, et al.
Pubblicazione: (2026)
Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection
di: Salehi, Alireza, et al.
Pubblicazione: (2025)
di: Salehi, Alireza, et al.
Pubblicazione: (2025)
FVO: Fast Visual Odometry with Transformers
di: Yugay, Vlardimir, et al.
Pubblicazione: (2025)
di: Yugay, Vlardimir, et al.
Pubblicazione: (2025)
GeneralAD: Anomaly Detection Across Domains by Attending to Distorted Features
di: Sträter, Luc P. J., et al.
Pubblicazione: (2024)
di: Sträter, Luc P. J., et al.
Pubblicazione: (2024)
NeoBabel: A Multilingual Open Tower for Visual Generation
di: Derakhshani, Mohammad Mahdi, et al.
Pubblicazione: (2025)
di: Derakhshani, Mohammad Mahdi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Prompt Diffusion Robustifies Any-Modality Prompt Learning
di: Du, Yingjun, et al.
Pubblicazione: (2024) -
QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain
di: Sun, Wenfang, et al.
Pubblicazione: (2024) -
IPO: Interpretable Prompt Optimization for Vision-Language Models
di: Du, Yingjun, et al.
Pubblicazione: (2024) -
RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
di: Sun, Wenfang, et al.
Pubblicazione: (2026) -
SuperDisco: Super-Class Discovery Improves Visual Recognition for the Long-Tail
di: Du, Yingjun, et al.
Pubblicazione: (2023)