MaskInversion: Localized Embeddings via Optimization of Explainability Maps
Fuente:
arXiv
Salvato in:
| Autori principali: | Bousselham, Walid, Chaybouti, Sofian, Rupprecht, Christian, Ferrari, Vittorio, Kuehne, Hilde |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LeGrad: An Explainability Method for Vision Transformers via Feature Formation Sensitivity
di: Bousselham, Walid, et al.
Pubblicazione: (2024)
di: Bousselham, Walid, et al.
Pubblicazione: (2024)
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
di: Chaybouti, Sofian, et al.
Pubblicazione: (2025)
di: Chaybouti, Sofian, et al.
Pubblicazione: (2025)
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
di: Bousselham, Walid, et al.
Pubblicazione: (2025)
di: Bousselham, Walid, et al.
Pubblicazione: (2025)
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
di: Bousselham, Walid, et al.
Pubblicazione: (2026)
di: Bousselham, Walid, et al.
Pubblicazione: (2026)
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
di: Jahagirdar, Soumya, et al.
Pubblicazione: (2026)
di: Jahagirdar, Soumya, et al.
Pubblicazione: (2026)
VideoGEM: Training-free Action Grounding in Videos
di: Vogel, Felix, et al.
Pubblicazione: (2025)
di: Vogel, Felix, et al.
Pubblicazione: (2025)
Unbiasing through Textual Descriptions: Mitigating Representation Bias in Video Benchmarks
di: Shvetsova, Nina, et al.
Pubblicazione: (2025)
di: Shvetsova, Nina, et al.
Pubblicazione: (2025)
HowToCaption: Prompting LLMs to Transform Video Annotations at Scale
di: Shvetsova, Nina, et al.
Pubblicazione: (2023)
di: Shvetsova, Nina, et al.
Pubblicazione: (2023)
TimeLogic: A Temporal Logic Benchmark for Video QA
di: Swetha, Sirnam, et al.
Pubblicazione: (2025)
di: Swetha, Sirnam, et al.
Pubblicazione: (2025)
SigLino: Efficient Multi-Teacher Distillation for Agglomerative Vision Foundation Models
di: Chaybouti, Sofian, et al.
Pubblicazione: (2025)
di: Chaybouti, Sofian, et al.
Pubblicazione: (2025)
Convolutional Differentiable Logic Gate Networks
di: Petersen, Felix, et al.
Pubblicazione: (2024)
di: Petersen, Felix, et al.
Pubblicazione: (2024)
Dual Guidance Semi-Supervised Action Detection
di: Singh, Ankit, et al.
Pubblicazione: (2025)
di: Singh, Ankit, et al.
Pubblicazione: (2025)
M2SVid: End-to-End Inpainting and Refinement for Monocular-to-Stereo Video Conversion
di: Shvetsova, Nina, et al.
Pubblicazione: (2025)
di: Shvetsova, Nina, et al.
Pubblicazione: (2025)
WEAR: An Outdoor Sports Dataset for Wearable and Egocentric Activity Recognition
di: Bock, Marius, et al.
Pubblicazione: (2023)
di: Bock, Marius, et al.
Pubblicazione: (2023)
Efficient Masked Face Recognition Method during the COVID-19 Pandemic
di: Hariri, Walid
Pubblicazione: (2021)
di: Hariri, Walid
Pubblicazione: (2021)
VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs
di: Törtei, Brigitta Malagurski, et al.
Pubblicazione: (2025)
di: Törtei, Brigitta Malagurski, et al.
Pubblicazione: (2025)
Falcon Perception
di: Bevli, Aviraj, et al.
Pubblicazione: (2026)
di: Bevli, Aviraj, et al.
Pubblicazione: (2026)
PoseDiffusion: Solving Pose Estimation via Diffusion-aided Bundle Adjustment
di: Wang, Jianyuan, et al.
Pubblicazione: (2023)
di: Wang, Jianyuan, et al.
Pubblicazione: (2023)
Probing into Camera Control of Video Models
di: Hou, Chen, et al.
Pubblicazione: (2026)
di: Hou, Chen, et al.
Pubblicazione: (2026)
MM-TS: Multi-Modal Temperature and Margin Schedules for Contrastive Learning with Long-Tail Data
di: Sheludzko, Siarhei, et al.
Pubblicazione: (2026)
di: Sheludzko, Siarhei, et al.
Pubblicazione: (2026)
DualPM: Dual Posed-Canonical Point Maps for 3D Shape and Pose Reconstruction
di: Kaye, Ben, et al.
Pubblicazione: (2024)
di: Kaye, Ben, et al.
Pubblicazione: (2024)
Teaching VLMs to Localize Specific Objects from In-context Examples
di: Doveh, Sivan, et al.
Pubblicazione: (2024)
di: Doveh, Sivan, et al.
Pubblicazione: (2024)
SHIC: Shape-Image Correspondences with no Keypoint Supervision
di: Shtedritski, Aleksandar, et al.
Pubblicazione: (2024)
di: Shtedritski, Aleksandar, et al.
Pubblicazione: (2024)
Explainable Continuous-Time Mask Refinement with Local Self-Similarity Priors for Medical Image Segmentation
di: Chatterjee, Rajdeep, et al.
Pubblicazione: (2026)
di: Chatterjee, Rajdeep, et al.
Pubblicazione: (2026)
Splatter Image: Ultra-Fast Single-View 3D Reconstruction
di: Szymanowicz, Stanislaw, et al.
Pubblicazione: (2023)
di: Szymanowicz, Stanislaw, et al.
Pubblicazione: (2023)
S3OD: Towards Generalizable Salient Object Detection with Synthetic Data
di: Kupyn, Orest, et al.
Pubblicazione: (2025)
di: Kupyn, Orest, et al.
Pubblicazione: (2025)
CAV-MAE Sync: Improving Contrastive Audio-Visual Mask Autoencoders via Fine-Grained Alignment
di: Araujo, Edson, et al.
Pubblicazione: (2025)
di: Araujo, Edson, et al.
Pubblicazione: (2025)
mWhisper-Flamingo for Multilingual Audio-Visual Noise-Robust Speech Recognition
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2025)
di: Rouditchenko, Andrew, et al.
Pubblicazione: (2025)
Dataset Enhancement with Instance-Level Augmentations
di: Kupyn, Orest, et al.
Pubblicazione: (2024)
di: Kupyn, Orest, et al.
Pubblicazione: (2024)
Mixed Degradation Image Restoration via Local Dynamic Optimization and Conditional Embedding
di: Gu, Yubin, et al.
Pubblicazione: (2024)
di: Gu, Yubin, et al.
Pubblicazione: (2024)
ShadowMaskFormer: Mask Augmented Patch Embeddings for Shadow Removal
di: Li, Zhuohao, et al.
Pubblicazione: (2024)
di: Li, Zhuohao, et al.
Pubblicazione: (2024)
Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation
di: Liu, Zhihua, et al.
Pubblicazione: (2025)
di: Liu, Zhihua, et al.
Pubblicazione: (2025)
Mask2Map: Vectorized HD Map Construction Using Bird's Eye View Segmentation Masks
di: Choi, Sehwan, et al.
Pubblicazione: (2024)
di: Choi, Sehwan, et al.
Pubblicazione: (2024)
Efficient and Explainable End-to-End Autonomous Driving via Masked Vision-Language-Action Diffusion
di: Zhang, Jiaru, et al.
Pubblicazione: (2026)
di: Zhang, Jiaru, et al.
Pubblicazione: (2026)
What, when, and where? -- Self-Supervised Spatio-Temporal Grounding in Untrimmed Multi-Action Videos from Narrated Instructions
di: Chen, Brian, et al.
Pubblicazione: (2023)
di: Chen, Brian, et al.
Pubblicazione: (2023)
Invisible Stitch: Generating Smooth 3D Scenes with Depth Inpainting
di: Engstler, Paul, et al.
Pubblicazione: (2024)
di: Engstler, Paul, et al.
Pubblicazione: (2024)
DragAPart: Learning a Part-Level Motion Prior for Articulated Objects
di: Li, Ruining, et al.
Pubblicazione: (2024)
di: Li, Ruining, et al.
Pubblicazione: (2024)
Scene-Conditional 3D Object Stylization and Composition
di: Zhou, Jinghao, et al.
Pubblicazione: (2023)
di: Zhou, Jinghao, et al.
Pubblicazione: (2023)
A Taxonomy and Library for Visualizing Learned Features in Convolutional Neural Networks
di: Grün, Felix, et al.
Pubblicazione: (2016)
di: Grün, Felix, et al.
Pubblicazione: (2016)
Diffusion Models for Open-Vocabulary Segmentation
di: Karazija, Laurynas, et al.
Pubblicazione: (2023)
di: Karazija, Laurynas, et al.
Pubblicazione: (2023)
Documenti analoghi
-
LeGrad: An Explainability Method for Vision Transformers via Feature Formation Sensitivity
di: Bousselham, Walid, et al.
Pubblicazione: (2024) -
REVEAL: Relation-based Video Representation Learning for Video-Question-Answering
di: Chaybouti, Sofian, et al.
Pubblicazione: (2025) -
VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation
di: Bousselham, Walid, et al.
Pubblicazione: (2025) -
DEX-AR: A Dynamic Explainability Method for Autoregressive Vision-Language Models
di: Bousselham, Walid, et al.
Pubblicazione: (2026) -
When LLaVA Meets Objects: Token Composition for Vision-Language-Models
di: Jahagirdar, Soumya, et al.
Pubblicazione: (2026)