A Text-Guided Vision Model for Enhanced Recognition of Small Instances
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Jung, Hyun-Ki |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
YOLO-Drone: An Efficient Object Detection Approach Using the GhostHead Network for Drone Images
par: Jung, Hyun-Ki
Publié: (2025)
par: Jung, Hyun-Ki
Publié: (2025)
Controllable and Efficient Multi-Class Pathology Nuclei Data Augmentation using Text-Conditioned Diffusion Models
par: Oh, Hyun-Jic, et autres
Publié: (2024)
par: Oh, Hyun-Jic, et autres
Publié: (2024)
IIR-VLM: In-Context Instance-level Recognition for Large Vision-Language Models
par: Shi, Liang, et autres
Publié: (2026)
par: Shi, Liang, et autres
Publié: (2026)
VIRES: Video Instance Repainting via Sketch and Text Guided Generation
par: Weng, Shuchen, et autres
Publié: (2024)
par: Weng, Shuchen, et autres
Publié: (2024)
Instruction-Guided Scene Text Recognition
par: Du, Yongkun, et autres
Publié: (2024)
par: Du, Yongkun, et autres
Publié: (2024)
Text Embedding Knows How to Quantize Text-Guided Diffusion Models
par: Lee, Hongjae, et autres
Publié: (2025)
par: Lee, Hongjae, et autres
Publié: (2025)
VisionTrap: Vision-Augmented Trajectory Prediction Guided by Textual Descriptions
par: Moon, Seokha, et autres
Publié: (2024)
par: Moon, Seokha, et autres
Publié: (2024)
IAM: Enhancing RGB-D Instance Segmentation with New Benchmarks
par: Jung, Aecheon, et autres
Publié: (2025)
par: Jung, Aecheon, et autres
Publié: (2025)
Retrieval-Enhanced Contrastive Vision-Text Models
par: Iscen, Ahmet, et autres
Publié: (2023)
par: Iscen, Ahmet, et autres
Publié: (2023)
Text-Guided Multi-Instance Learning for Scoliosis Screening via Gait Video Analysis
par: Li, Haiqing, et autres
Publié: (2025)
par: Li, Haiqing, et autres
Publié: (2025)
HTR-VT: Handwritten Text Recognition with Vision Transformer
par: Li, Yuting, et autres
Publié: (2024)
par: Li, Yuting, et autres
Publié: (2024)
SIT-FER: Integration of Semantic-, Instance-, Text-level Information for Semi-supervised Facial Expression Recognition
par: Ding, Sixian, et autres
Publié: (2025)
par: Ding, Sixian, et autres
Publié: (2025)
Instance Brownian Bridge as Texts for Open-vocabulary Video Instance Segmentation
par: Cheng, Zesen, et autres
Publié: (2024)
par: Cheng, Zesen, et autres
Publié: (2024)
Facial Emotion Learning with Text-Guided Multiview Fusion via Vision-Language Model for 3D/4D Facial Expression Recognition
par: Behzad, Muzammil
Publié: (2025)
par: Behzad, Muzammil
Publié: (2025)
ReaMIL: Reasoning- and Evidence-Aware Multiple Instance Learning for Whole-Slide Histopathology
par: Jung, Hyun Do, et autres
Publié: (2026)
par: Jung, Hyun Do, et autres
Publié: (2026)
GALAR-TemporalNet v2: Anatomy-Guided Dual-Branch Temporal Classification with Bidirectional Mamba and Dual-Graph GCN for Video Capsule Endoscopy -- after competition results
par: Won, Jiye, et autres
Publié: (2026)
par: Won, Jiye, et autres
Publié: (2026)
HotSpotter - Patterned Species Instance Recognition
par: Crall, Jonathan P., et autres
Publié: (2025)
par: Crall, Jonathan P., et autres
Publié: (2025)
Tag2Text: Guiding Vision-Language Model via Image Tagging
par: Huang, Xinyu, et autres
Publié: (2023)
par: Huang, Xinyu, et autres
Publié: (2023)
UNIT: Unifying Image and Text Recognition in One Vision Encoder
par: Zhu, Yi, et autres
Publié: (2024)
par: Zhu, Yi, et autres
Publié: (2024)
Continual Multiple Instance Learning with Enhanced Localization for Histopathological Whole Slide Image Analysis
par: Lee, Byung Hyun, et autres
Publié: (2025)
par: Lee, Byung Hyun, et autres
Publié: (2025)
Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models
par: Waseda, Futa, et autres
Publié: (2025)
par: Waseda, Futa, et autres
Publié: (2025)
Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition
par: Shang, Tianyi, et autres
Publié: (2025)
par: Shang, Tianyi, et autres
Publié: (2025)
Enhancing Table Recognition with Vision LLMs: A Benchmark and Neighbor-Guided Toolchain Reasoner
par: Zhou, Yitong, et autres
Publié: (2024)
par: Zhou, Yitong, et autres
Publié: (2024)
Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models
par: Waseda, Futa, et autres
Publié: (2025)
par: Waseda, Futa, et autres
Publié: (2025)
Class-Aware Mask-Guided Feature Refinement for Scene Text Recognition
par: Yang, Mingkun, et autres
Publié: (2024)
par: Yang, Mingkun, et autres
Publié: (2024)
P3T: Prototypical Point-level Prompt Tuning with Enhanced Generalization for 3D Vision-Language Models
par: Jung, Geunyoung, et autres
Publié: (2026)
par: Jung, Geunyoung, et autres
Publié: (2026)
SVIPTR: Fast and Efficient Scene Text Recognition with Vision Permutable Extractor
par: Cheng, Xianfu, et autres
Publié: (2024)
par: Cheng, Xianfu, et autres
Publié: (2024)
CLIP4STR: A Simple Baseline for Scene Text Recognition with Pre-trained Vision-Language Model
par: Zhao, Shuai, et autres
Publié: (2023)
par: Zhao, Shuai, et autres
Publié: (2023)
Integrated Image-Text Based on Semi-supervised Learning for Small Sample Instance Segmentation
par: Chi, Ruting, et autres
Publié: (2024)
par: Chi, Ruting, et autres
Publié: (2024)
Depth-Guided Semi-Supervised Instance Segmentation
par: Chen, Xin, et autres
Publié: (2024)
par: Chen, Xin, et autres
Publié: (2024)
Unified Multi-Foundation-Model Slide Representation for Pan-Cancer Recognition and Text-Guided Tumor Localization
par: Wang, Tianyang, et autres
Publié: (2026)
par: Wang, Tianyang, et autres
Publié: (2026)
3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding
par: Xia, Zhongyu, et autres
Publié: (2026)
par: Xia, Zhongyu, et autres
Publié: (2026)
UniTabNet: Bridging Vision and Language Models for Enhanced Table Structure Recognition
par: Zhang, Zhenrong, et autres
Publié: (2024)
par: Zhang, Zhenrong, et autres
Publié: (2024)
Co-synthesis of Histopathology Nuclei Image-Label Pairs using a Context-Conditioned Joint Diffusion Model
par: Min, Seonghui, et autres
Publié: (2024)
par: Min, Seonghui, et autres
Publié: (2024)
Efficient and Accurate Scene Text Recognition with Cascaded-Transformers
par: Ozkan, Savas, et autres
Publié: (2025)
par: Ozkan, Savas, et autres
Publié: (2025)
Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models
par: Quan, Rong, et autres
Publié: (2026)
par: Quan, Rong, et autres
Publié: (2026)
Text-Enhanced Zero-Shot Action Recognition: A training-free approach
par: Bosetti, Massimo, et autres
Publié: (2024)
par: Bosetti, Massimo, et autres
Publié: (2024)
GMT: Guided Mask Transformer for Leaf Instance Segmentation
par: Chen, Feng, et autres
Publié: (2024)
par: Chen, Feng, et autres
Publié: (2024)
VISAGE: Video Instance Segmentation with Appearance-Guided Enhancement
par: Kim, Hanjung, et autres
Publié: (2023)
par: Kim, Hanjung, et autres
Publié: (2023)
Recoverable Compression: A Multimodal Vision Token Recovery Mechanism Guided by Text Information
par: Chen, Yi, et autres
Publié: (2024)
par: Chen, Yi, et autres
Publié: (2024)
Documents similaires
-
YOLO-Drone: An Efficient Object Detection Approach Using the GhostHead Network for Drone Images
par: Jung, Hyun-Ki
Publié: (2025) -
Controllable and Efficient Multi-Class Pathology Nuclei Data Augmentation using Text-Conditioned Diffusion Models
par: Oh, Hyun-Jic, et autres
Publié: (2024) -
IIR-VLM: In-Context Instance-level Recognition for Large Vision-Language Models
par: Shi, Liang, et autres
Publié: (2026) -
VIRES: Video Instance Repainting via Sketch and Text Guided Generation
par: Weng, Shuchen, et autres
Publié: (2024) -
Instruction-Guided Scene Text Recognition
par: Du, Yongkun, et autres
Publié: (2024)