Free-Grained Hierarchical Visual Recognition
Fuente:
arXiv
Salvato in:
| Autori principali: | Park, Seulki, Wang, Zilin, Yu, Stella X. |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Visually Consistent Hierarchical Image Classification
di: Park, Seulki, et al.
Pubblicazione: (2024)
di: Park, Seulki, et al.
Pubblicazione: (2024)
Vision Harnessing Agent for Open Ad-hoc Segmentation
di: Wang, Zilin, et al.
Pubblicazione: (2026)
di: Wang, Zilin, et al.
Pubblicazione: (2026)
Designing Extremely Memory-Efficient CNNs for On-device Vision Tasks
di: Lee, Jaewook, et al.
Pubblicazione: (2024)
di: Lee, Jaewook, et al.
Pubblicazione: (2024)
Aligning Forest and Trees in Images & Long Captions for Visually Grounded Understanding
di: Woo, Byeongju, et al.
Pubblicazione: (2026)
di: Woo, Byeongju, et al.
Pubblicazione: (2026)
Hierarchical Visual Feature Aggregation for OCR-Free Document Understanding
di: Park, Jaeyoo, et al.
Pubblicazione: (2024)
di: Park, Jaeyoo, et al.
Pubblicazione: (2024)
Open Ad-hoc Categorization with Contextualized Feature Learning
di: Wang, Zilin, et al.
Pubblicazione: (2025)
di: Wang, Zilin, et al.
Pubblicazione: (2025)
M2Former: Multi-Scale Patch Selection for Fine-Grained Visual Recognition
di: Moon, Jiyong, et al.
Pubblicazione: (2023)
di: Moon, Jiyong, et al.
Pubblicazione: (2023)
Grounding Language Models for Visual Entity Recognition
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
di: Xiao, Zilin, et al.
Pubblicazione: (2024)
Efficient Vocabulary-Free Fine-Grained Visual Recognition in the Age of Multimodal LLMs
di: Kuchibhotla, Hari Chandana, et al.
Pubblicazione: (2025)
di: Kuchibhotla, Hari Chandana, et al.
Pubblicazione: (2025)
On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices
di: Kim, Bosung, et al.
Pubblicazione: (2025)
di: Kim, Bosung, et al.
Pubblicazione: (2025)
On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices
di: Kim, Bosung, et al.
Pubblicazione: (2025)
di: Kim, Bosung, et al.
Pubblicazione: (2025)
Normalize Filters! Classical Wisdom for Deep Vision
di: Perez, Gustavo, et al.
Pubblicazione: (2025)
di: Perez, Gustavo, et al.
Pubblicazione: (2025)
Cross-Hierarchical Bidirectional Consistency Learning for Fine-Grained Visual Classification
di: Gao, Pengxiang, et al.
Pubblicazione: (2025)
di: Gao, Pengxiang, et al.
Pubblicazione: (2025)
Learning Hierarchical Image Segmentation For Recognition and By Recognition
di: Ke, Tsung-Wei, et al.
Pubblicazione: (2022)
di: Ke, Tsung-Wei, et al.
Pubblicazione: (2022)
Hierarchical Graph Feature Enhancement with Adaptive Frequency Modulation for Visual Recognition
di: Zhao, Feiyue, et al.
Pubblicazione: (2025)
di: Zhao, Feiyue, et al.
Pubblicazione: (2025)
Hierarchical Augmentation and Distillation for Class Incremental Audio-Visual Video Recognition
di: Zuo, Yukun, et al.
Pubblicazione: (2024)
di: Zuo, Yukun, et al.
Pubblicazione: (2024)
Towards Privacy-Preserving Fine-Grained Visual Classification via Hierarchical Learning from Label Proportions
di: Chang, Jinyi, et al.
Pubblicazione: (2025)
di: Chang, Jinyi, et al.
Pubblicazione: (2025)
TAMT: Temporal-Aware Model Tuning for Cross-Domain Few-Shot Action Recognition
di: Wang, Yilong, et al.
Pubblicazione: (2024)
di: Wang, Yilong, et al.
Pubblicazione: (2024)
On Learning Discriminative Features from Synthesized Data for Self-Supervised Fine-Grained Visual Recognition
di: Wang, Zihu, et al.
Pubblicazione: (2024)
di: Wang, Zihu, et al.
Pubblicazione: (2024)
Dialogue Director: Bridging the Gap in Dialogue Visualization for Multimodal Storytelling
di: Zhang, Min, et al.
Pubblicazione: (2024)
di: Zhang, Min, et al.
Pubblicazione: (2024)
Mixture-of-Modality-Experts with Holistic Token Learning for Fine-Grained Multimodal Visual Analytics in Driver Action Recognition
di: Liu, Tianyi, et al.
Pubblicazione: (2026)
di: Liu, Tianyi, et al.
Pubblicazione: (2026)
PlainMamba: Improving Non-Hierarchical Mamba in Visual Recognition
di: Yang, Chenhongyi, et al.
Pubblicazione: (2024)
di: Yang, Chenhongyi, et al.
Pubblicazione: (2024)
XR-VLM: Cross-Relationship Modeling with Multi-part Prompts and Visual Features for Fine-Grained Recognition
di: Wang, Chuanming, et al.
Pubblicazione: (2025)
di: Wang, Chuanming, et al.
Pubblicazione: (2025)
UniDGF: A Unified Detection-to-Generation Framework for Hierarchical Object Visual Recognition
di: Nan, Xinyu, et al.
Pubblicazione: (2025)
di: Nan, Xinyu, et al.
Pubblicazione: (2025)
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
di: Yang, Lei, et al.
Pubblicazione: (2026)
di: Yang, Lei, et al.
Pubblicazione: (2026)
Novel View Synthesis from A Few Glimpses via Test-Time Natural Video Completion
di: Xu, Yan, et al.
Pubblicazione: (2025)
di: Xu, Yan, et al.
Pubblicazione: (2025)
Hierarchical Space-Time Attention for Micro-Expression Recognition
di: Hao, Haihong, et al.
Pubblicazione: (2024)
di: Hao, Haihong, et al.
Pubblicazione: (2024)
Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding
di: Guo, Leilei, et al.
Pubblicazione: (2025)
di: Guo, Leilei, et al.
Pubblicazione: (2025)
Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs
di: Demidov, Dmitry, et al.
Pubblicazione: (2025)
di: Demidov, Dmitry, et al.
Pubblicazione: (2025)
Distributed Zero-Shot Learning for Visual Recognition
di: Chen, Zhi, et al.
Pubblicazione: (2025)
di: Chen, Zhi, et al.
Pubblicazione: (2025)
Decoupled Hierarchical Distillation for Multimodal Emotion Recognition
di: Li, Yong, et al.
Pubblicazione: (2026)
di: Li, Yong, et al.
Pubblicazione: (2026)
Register assisted aggregation for Visual Place Recognition
di: Yu, Xuan, et al.
Pubblicazione: (2024)
di: Yu, Xuan, et al.
Pubblicazione: (2024)
Extract More from Less: Efficient Fine-Grained Visual Recognition in Low-Data Regimes
di: Demidov, Dmitry, et al.
Pubblicazione: (2024)
di: Demidov, Dmitry, et al.
Pubblicazione: (2024)
Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies
di: Pang, Cong, et al.
Pubblicazione: (2025)
di: Pang, Cong, et al.
Pubblicazione: (2025)
SHED Light on Segmentation for Dense Prediction
di: Lee, Seung Hyun, et al.
Pubblicazione: (2026)
di: Lee, Seung Hyun, et al.
Pubblicazione: (2026)
UniFormer: Unifying Convolution and Self-attention for Visual Recognition
di: Li, Kunchang, et al.
Pubblicazione: (2022)
di: Li, Kunchang, et al.
Pubblicazione: (2022)
DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual Understanding
di: Li, Geng, et al.
Pubblicazione: (2025)
di: Li, Geng, et al.
Pubblicazione: (2025)
VOLoc: Visual Place Recognition by Querying Compressed Lidar Map
di: Cai, Xudong, et al.
Pubblicazione: (2024)
di: Cai, Xudong, et al.
Pubblicazione: (2024)
LoDisc: Learning Global-Local Discriminative Features for Self-Supervised Fine-Grained Visual Recognition
di: Shi, Jialu, et al.
Pubblicazione: (2024)
di: Shi, Jialu, et al.
Pubblicazione: (2024)
Zero-Shot Chinese Character Recognition with Hierarchical Multi-Granularity Image-Text Aligning
di: Zhu, Yinglian, et al.
Pubblicazione: (2025)
di: Zhu, Yinglian, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Visually Consistent Hierarchical Image Classification
di: Park, Seulki, et al.
Pubblicazione: (2024) -
Vision Harnessing Agent for Open Ad-hoc Segmentation
di: Wang, Zilin, et al.
Pubblicazione: (2026) -
Designing Extremely Memory-Efficient CNNs for On-device Vision Tasks
di: Lee, Jaewook, et al.
Pubblicazione: (2024) -
Aligning Forest and Trees in Images & Long Captions for Visually Grounded Understanding
di: Woo, Byeongju, et al.
Pubblicazione: (2026) -
Hierarchical Visual Feature Aggregation for OCR-Free Document Understanding
di: Park, Jaeyoo, et al.
Pubblicazione: (2024)