Seeing Beyond Classes: Zero-Shot Grounded Situation Recognition via Language Explainer
Fuente:
arXiv
Guardado en:
| Autores principales: | Lei, Jiaming, Li, Lin, Wang, Chunping, Xiao, Jun, Chen, Long |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
$\text{H}^2$em: Learning Hierarchical Hyperbolic Embeddings for Compositional Zero-Shot Learning
por: Li, Lin, et al.
Publicado: (2025)
por: Li, Lin, et al.
Publicado: (2025)
SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding
por: Li, Rong, et al.
Publicado: (2024)
por: Li, Rong, et al.
Publicado: (2024)
Compositional Zero-shot Learning via Progressive Language-based Observations
por: Li, Lin, et al.
Publicado: (2023)
por: Li, Lin, et al.
Publicado: (2023)
Solving Zero-Shot 3D Visual Grounding as Constraint Satisfaction Problems
por: Yuan, Qihao, et al.
Publicado: (2024)
por: Yuan, Qihao, et al.
Publicado: (2024)
Zero-shot Compositional Action Recognition with Neural Logic Constraints
por: Ye, Gefan, et al.
Publicado: (2025)
por: Ye, Gefan, et al.
Publicado: (2025)
Compositional Feature Augmentation for Unbiased Scene Graph Generation
por: Li, Lin, et al.
Publicado: (2023)
por: Li, Lin, et al.
Publicado: (2023)
Beyond Heuristic Prompting: A Concept-Guided Bayesian Framework for Zero-Shot Image Recognition
por: Liu, Hui, et al.
Publicado: (2026)
por: Liu, Hui, et al.
Publicado: (2026)
Language Model as Visual Explainer
por: Yang, Xingyi, et al.
Publicado: (2024)
por: Yang, Xingyi, et al.
Publicado: (2024)
Distributed Zero-Shot Learning for Visual Recognition
por: Chen, Zhi, et al.
Publicado: (2025)
por: Chen, Zhi, et al.
Publicado: (2025)
FlowComposer: Composable Flows for Compositional Zero-Shot Learning
por: He, Zhenqi, et al.
Publicado: (2026)
por: He, Zhenqi, et al.
Publicado: (2026)
Task-Specific Distance Correlation Matching for Few-Shot Action Recognition
por: Long, Fei, et al.
Publicado: (2025)
por: Long, Fei, et al.
Publicado: (2025)
C2C: Component-to-Composition Learning for Zero-Shot Compositional Action Recognition
por: Li, Rongchang, et al.
Publicado: (2024)
por: Li, Rongchang, et al.
Publicado: (2024)
Grounding Descriptions in Images informs Zero-Shot Visual Recognition
por: Halbe, Shaunak, et al.
Publicado: (2024)
por: Halbe, Shaunak, et al.
Publicado: (2024)
DA-Font: Few-Shot Font Generation via Dual-Attention Hybrid Integration
por: Chen, Weiran, et al.
Publicado: (2025)
por: Chen, Weiran, et al.
Publicado: (2025)
$\text{Di}^2\text{Pose}$: Discrete Diffusion Model for Occluded 3D Human Pose Estimation
por: Wang, Weiquan, et al.
Publicado: (2024)
por: Wang, Weiquan, et al.
Publicado: (2024)
EZSR: Event-based Zero-Shot Recognition
por: Yang, Yan, et al.
Publicado: (2024)
por: Yang, Yan, et al.
Publicado: (2024)
Liberating Seen Classes: Boosting Few-Shot and Zero-Shot Text Classification via Anchor Generation and Classification Reframing
por: Liu, Han, et al.
Publicado: (2024)
por: Liu, Han, et al.
Publicado: (2024)
Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval
por: Liao, Liwei, et al.
Publicado: (2025)
por: Liao, Liwei, et al.
Publicado: (2025)
Zero-Shot Underwater Gesture Recognition
por: Sarma, Sandipan, et al.
Publicado: (2024)
por: Sarma, Sandipan, et al.
Publicado: (2024)
Zero-Shot 3D Visual Grounding from Vision-Language Models
por: Li, Rong, et al.
Publicado: (2025)
por: Li, Rong, et al.
Publicado: (2025)
Ca2-VDM: Efficient Autoregressive Video Diffusion Model with Causal Generation and Cache Sharing
por: Gao, Kaifeng, et al.
Publicado: (2024)
por: Gao, Kaifeng, et al.
Publicado: (2024)
Situat3DChange: Situated 3D Change Understanding Dataset for Multimodal Large Language Model
por: Liu, Ruiping, et al.
Publicado: (2025)
por: Liu, Ruiping, et al.
Publicado: (2025)
From Semantics, Scene to Instance-awareness: Distilling Foundation Model for Grounded Open-vocabulary Situation Recognition
por: Cai, Chen, et al.
Publicado: (2025)
por: Cai, Chen, et al.
Publicado: (2025)
What Do You See? Enhancing Zero-Shot Image Classification with Multimodal Large Language Models
por: Abdelhamed, Abdelrahman, et al.
Publicado: (2024)
por: Abdelhamed, Abdelrahman, et al.
Publicado: (2024)
Zero-P-to-3: Zero-Shot Partial-View Images to 3D Object
por: Lin, Yuxuan, et al.
Publicado: (2025)
por: Lin, Yuxuan, et al.
Publicado: (2025)
Seeing Beyond the Scene: Enhancing Vision-Language Models with Interactional Reasoning
por: Liang, Dayong, et al.
Publicado: (2025)
por: Liang, Dayong, et al.
Publicado: (2025)
VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding
por: Xu, Runsen, et al.
Publicado: (2024)
por: Xu, Runsen, et al.
Publicado: (2024)
ZONE: Zero-Shot Instruction-Guided Local Editing
por: Li, Shanglin, et al.
Publicado: (2023)
por: Li, Shanglin, et al.
Publicado: (2023)
Zero-Shot Class Unlearning in CLIP with Synthetic Samples
por: Kravets, A., et al.
Publicado: (2024)
por: Kravets, A., et al.
Publicado: (2024)
Zero-Shot Synthetic-to-Real Handwritten Text Recognition via Task Analogies
por: Garrido-Munoz, Carlos, et al.
Publicado: (2026)
por: Garrido-Munoz, Carlos, et al.
Publicado: (2026)
What's in a Name? Beyond Class Indices for Image Recognition
por: Han, Kai, et al.
Publicado: (2023)
por: Han, Kai, et al.
Publicado: (2023)
Zero-Shot Video Translation via Token Warping
por: Zhu, Haiming, et al.
Publicado: (2024)
por: Zhu, Haiming, et al.
Publicado: (2024)
Benchmarking Zero-Shot Recognition with Vision-Language Models: Challenges on Granularity and Specificity
por: Xu, Zhenlin, et al.
Publicado: (2023)
por: Xu, Zhenlin, et al.
Publicado: (2023)
Seeing the Unseen: Towards Zero-Shot Inspection for Wind Turbine Blades using Knowledge-Augmented Vision Language Models
por: Zhang, Yang, et al.
Publicado: (2025)
por: Zhang, Yang, et al.
Publicado: (2025)
Continual Learning Improves Zero-Shot Action Recognition
por: Gowda, Shreyank N, et al.
Publicado: (2024)
por: Gowda, Shreyank N, et al.
Publicado: (2024)
Novel Semantic Prompting for Zero-Shot Action Recognition
por: Iqbal, Salman, et al.
Publicado: (2026)
por: Iqbal, Salman, et al.
Publicado: (2026)
Think, Act, Build: An Agentic Framework with Vision Language Models for Zero-Shot 3D Visual Grounding
por: Wang, Haibo, et al.
Publicado: (2026)
por: Wang, Haibo, et al.
Publicado: (2026)
An Information Compensation Framework for Zero-Shot Skeleton-based Action Recognition
por: Xu, Haojun, et al.
Publicado: (2024)
por: Xu, Haojun, et al.
Publicado: (2024)
Zero-Shot Open-Vocabulary Human Motion Grounding with Test-Time Training
por: Zhou, Yunjiao, et al.
Publicado: (2025)
por: Zhou, Yunjiao, et al.
Publicado: (2025)
Training-Free Zero-Shot Temporal Action Detection with Vision-Language Models
por: Han, Chaolei, et al.
Publicado: (2025)
por: Han, Chaolei, et al.
Publicado: (2025)
Ejemplares similares
-
$\text{H}^2$em: Learning Hierarchical Hyperbolic Embeddings for Compositional Zero-Shot Learning
por: Li, Lin, et al.
Publicado: (2025) -
SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding
por: Li, Rong, et al.
Publicado: (2024) -
Compositional Zero-shot Learning via Progressive Language-based Observations
por: Li, Lin, et al.
Publicado: (2023) -
Solving Zero-Shot 3D Visual Grounding as Constraint Satisfaction Problems
por: Yuan, Qihao, et al.
Publicado: (2024) -
Zero-shot Compositional Action Recognition with Neural Logic Constraints
por: Ye, Gefan, et al.
Publicado: (2025)