PEEB: Part-based Image Classifiers with an Explainable and Editable Language Bottleneck
Fuente:
arXiv
Guardado en:
| Autores principales: | Pham, Thang M., Chen, Peijie, Nguyen, Tin, Yoon, Seunghyun, Bui, Trung, Nguyen, Anh Totti |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Leveraging Habitat Information for Fine-grained Bird Identification
por: Nguyen, Tin, et al.
Publicado: (2023)
por: Nguyen, Tin, et al.
Publicado: (2023)
TAB: Transformer Attention Bottlenecks enable User Intervention and Debugging in Vision-Language Models
por: Rahmanzadehgervi, Pooyan, et al.
Publicado: (2024)
por: Rahmanzadehgervi, Pooyan, et al.
Publicado: (2024)
FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation
por: Jing, Liqiang, et al.
Publicado: (2025)
por: Jing, Liqiang, et al.
Publicado: (2025)
Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage
por: Lee, Saehyung, et al.
Publicado: (2024)
por: Lee, Saehyung, et al.
Publicado: (2024)
MS4UI: A Dataset for Multi-modal Summarization of User Interface Instructional Videos
por: Zang, Yuan, et al.
Publicado: (2025)
por: Zang, Yuan, et al.
Publicado: (2025)
SketchVLM: Vision language models can annotate images to explain thoughts and guide users
por: Collins, Brandon, et al.
Publicado: (2026)
por: Collins, Brandon, et al.
Publicado: (2026)
Supercharged One-step Text-to-Image Diffusion Models with Negative Prompts
por: Nguyen, Viet, et al.
Publicado: (2024)
por: Nguyen, Viet, et al.
Publicado: (2024)
PCNN: Probable-Class Nearest-Neighbor Explanations Improve Fine-Grained Image Classification Accuracy for AIs and Humans
por: Giang, et al.
Publicado: (2023)
por: Giang, et al.
Publicado: (2023)
Assessing News Thumbnail Representativeness: Counterfactual text can enhance the cross-modal matching ability
por: Yoon, Yejun, et al.
Publicado: (2024)
por: Yoon, Yejun, et al.
Publicado: (2024)
Understanding Generative AI Capabilities in Everyday Image Editing Tasks
por: Taesiri, Mohammad Reza, et al.
Publicado: (2025)
por: Taesiri, Mohammad Reza, et al.
Publicado: (2025)
Linguistically Informed Multimodal Fusion for Vietnamese Scene-Text Image Captioning: Dataset, Graph Framework, and Phonological Attention
por: Nguyen, Nhi Ngoc-Yen, et al.
Publicado: (2026)
por: Nguyen, Nhi Ngoc-Yen, et al.
Publicado: (2026)
LiteGPT: Large Vision-Language Model for Joint Chest X-ray Localization and Classification Task
por: Le-Duc, Khai, et al.
Publicado: (2024)
por: Le-Duc, Khai, et al.
Publicado: (2024)
HoT: Highlighted Chain of Thought for Referencing Supporting Facts from Inputs
por: Nguyen, Tin, et al.
Publicado: (2025)
por: Nguyen, Tin, et al.
Publicado: (2025)
FlexEdit: Flexible and Controllable Diffusion-based Object-centric Image Editing
por: Nguyen, Trong-Tung, et al.
Publicado: (2024)
por: Nguyen, Trong-Tung, et al.
Publicado: (2024)
MedSteer: Counterfactual Endoscopic Synthesis via Training-Free Activation Steering
por: Pham, Trong-Thang, et al.
Publicado: (2026)
por: Pham, Trong-Thang, et al.
Publicado: (2026)
Vision Language Models are Biased
por: Vo, An, et al.
Publicado: (2025)
por: Vo, An, et al.
Publicado: (2025)
DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding
por: Nguyen, Thong, et al.
Publicado: (2023)
por: Nguyen, Thong, et al.
Publicado: (2023)
Improving Zero-Shot Object-Level Change Detection by Incorporating Visual Correspondence
por: Nguyen, Hung Huy, et al.
Publicado: (2025)
por: Nguyen, Hung Huy, et al.
Publicado: (2025)
StreamGaze: Gaze-Guided Temporal Reasoning and Proactive Understanding in Streaming Videos
por: Lee, Daeun, et al.
Publicado: (2025)
por: Lee, Daeun, et al.
Publicado: (2025)
SlimLM: An Efficient Small Language Model for On-Device Document Assistance
por: Pham, Thang M., et al.
Publicado: (2024)
por: Pham, Thang M., et al.
Publicado: (2024)
CutPaste&Find: Efficient Multimodal Hallucination Detector with Visual-aid Knowledge Base
por: Nguyen, Cong-Duy, et al.
Publicado: (2025)
por: Nguyen, Cong-Duy, et al.
Publicado: (2025)
TI-JEPA: An Innovative Energy-based Joint Embedding Strategy for Text-Image Multimodal Systems
por: Vo, Khang H. N., et al.
Publicado: (2025)
por: Vo, Khang H. N., et al.
Publicado: (2025)
VLEER: Vision and Language Embeddings for Explainable Whole Slide Image Representation
por: Nguyen, Anh Tien, et al.
Publicado: (2025)
por: Nguyen, Anh Tien, et al.
Publicado: (2025)
Cross-Modal Rationale Transfer for Explainable Humanitarian Classification on Social Media
por: Nguyen, Thi Huyen, et al.
Publicado: (2026)
por: Nguyen, Thi Huyen, et al.
Publicado: (2026)
READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling
por: Nguyen, Thong, et al.
Publicado: (2023)
por: Nguyen, Thong, et al.
Publicado: (2023)
SuMa: A Subspace Mapping Approach for Robust and Effective Concept Erasure in Text-to-Image Diffusion Models
por: Nguyen, Kien, et al.
Publicado: (2025)
por: Nguyen, Kien, et al.
Publicado: (2025)
SwiftEdit: Lightning Fast Text-Guided Image Editing via One-Step Diffusion
por: Nguyen, Trong-Tung, et al.
Publicado: (2024)
por: Nguyen, Trong-Tung, et al.
Publicado: (2024)
Stable Messenger: Steganography for Message-Concealed Image Generation
por: Nguyen, Quang, et al.
Publicado: (2023)
por: Nguyen, Quang, et al.
Publicado: (2023)
PADM: A Physics-aware Diffusion Model for Attenuation Correction
por: Pham, Trung Kien, et al.
Publicado: (2025)
por: Pham, Trung Kien, et al.
Publicado: (2025)
Accelerating Conditional Prompt Learning via Masked Image Modeling for Vision-Language Models
por: Bui, Phuoc-Nguyen, et al.
Publicado: (2025)
por: Bui, Phuoc-Nguyen, et al.
Publicado: (2025)
MAMA: Meta-optimized Angular Margin Contrastive Framework for Video-Language Representation Learning
por: Nguyen, Thong, et al.
Publicado: (2024)
por: Nguyen, Thong, et al.
Publicado: (2024)
Fourier-Attentive Representation Learning: A Fourier-Guided Framework for Few-Shot Generalization in Vision-Language Models
por: Pham, Hieu Dinh Trung, et al.
Publicado: (2025)
por: Pham, Hieu Dinh Trung, et al.
Publicado: (2025)
A Hybrid Vision Transformer Approach for Mathematical Expression Recognition
por: Le, Anh Duy, et al.
Publicado: (2026)
por: Le, Anh Duy, et al.
Publicado: (2026)
GPC: Generative and General Pathology Image Classifier
por: Nguyen, Anh Tien, et al.
Publicado: (2024)
por: Nguyen, Anh Tien, et al.
Publicado: (2024)
CT-ScanGaze: A Dataset and Baselines for 3D Volumetric Scanpath Modeling
por: Pham, Trong-Thang, et al.
Publicado: (2025)
por: Pham, Trong-Thang, et al.
Publicado: (2025)
ViConsFormer: Constituting Meaningful Phrases of Scene Texts using Transformer-based Method in Vietnamese Text-based Visual Question Answering
por: Nguyen, Nghia Hieu, et al.
Publicado: (2024)
por: Nguyen, Nghia Hieu, et al.
Publicado: (2024)
ICM-Assistant: Instruction-tuning Multimodal Large Language Models for Rule-based Explainable Image Content Moderation
por: Wu, Mengyang, et al.
Publicado: (2024)
por: Wu, Mengyang, et al.
Publicado: (2024)
Frequency Adapter with SAM for Generalized Medical Image Segmentation
por: Bui, Phuoc-Nguyen, et al.
Publicado: (2026)
por: Bui, Phuoc-Nguyen, et al.
Publicado: (2026)
UIT-DarkCow team at ImageCLEFmedical Caption 2024: Diagnostic Captioning for Radiology Images Efficiency with Transformer Models
por: Van Nguyen, Quan, et al.
Publicado: (2024)
por: Van Nguyen, Quan, et al.
Publicado: (2024)
Vision language models are blind: Failing to translate detailed visual features into words
por: Rahmanzadehgervi, Pooyan, et al.
Publicado: (2024)
por: Rahmanzadehgervi, Pooyan, et al.
Publicado: (2024)
Ejemplares similares
-
Leveraging Habitat Information for Fine-grained Bird Identification
por: Nguyen, Tin, et al.
Publicado: (2023) -
TAB: Transformer Attention Bottlenecks enable User Intervention and Debugging in Vision-Language Models
por: Rahmanzadehgervi, Pooyan, et al.
Publicado: (2024) -
FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation
por: Jing, Liqiang, et al.
Publicado: (2025) -
Toward Robust Hyper-Detailed Image Captioning: A Multiagent Approach and Dual Evaluation Metrics for Factuality and Coverage
por: Lee, Saehyung, et al.
Publicado: (2024) -
MS4UI: A Dataset for Multi-modal Summarization of User Interface Instructional Videos
por: Zang, Yuan, et al.
Publicado: (2025)