TWIST & SCOUT: Grounding Multimodal LLM-Experts by Forget-Free Tuning
Fuente:
arXiv
Guardado en:
| Autores principales: | Bhowmik, Aritra, Derakhshani, Mohammad Mahdi, Koelma, Dennis, Asano, Yuki M., Oswald, Martin R., Snoek, Cees G. M. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Union-over-Intersections: Object Detection beyond Winner-Takes-All
por: Bhowmik, Aritra, et al.
Publicado: (2023)
por: Bhowmik, Aritra, et al.
Publicado: (2023)
TULIP: Token-length Upgraded CLIP
por: Najdenkoska, Ivona, et al.
Publicado: (2024)
por: Najdenkoska, Ivona, et al.
Publicado: (2024)
NeoBabel: A Multilingual Open Tower for Visual Generation
por: Derakhshani, Mohammad Mahdi, et al.
Publicado: (2025)
por: Derakhshani, Mohammad Mahdi, et al.
Publicado: (2025)
Any-Shift Prompting for Generalization over Distributions
por: Xiao, Zehao, et al.
Publicado: (2024)
por: Xiao, Zehao, et al.
Publicado: (2024)
MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
por: Bhowmik, Aritra, et al.
Publicado: (2025)
por: Bhowmik, Aritra, et al.
Publicado: (2025)
Segment Any 3D-Part in a Scene from a Sentence
por: Wu, Hongyu, et al.
Publicado: (2025)
por: Wu, Hongyu, et al.
Publicado: (2025)
PIN: Positional Insert Unlocks Object Localisation Abilities in VLMs
por: Dorkenwald, Michael, et al.
Publicado: (2024)
por: Dorkenwald, Michael, et al.
Publicado: (2024)
SimPLR: A Simple and Plain Transformer for Efficient Object Detection and Segmentation
por: Nguyen, Duy-Kien, et al.
Publicado: (2023)
por: Nguyen, Duy-Kien, et al.
Publicado: (2023)
Continual Hyperbolic Learning of Instances and Classes
por: Ayoughi, Melika, et al.
Publicado: (2025)
por: Ayoughi, Melika, et al.
Publicado: (2025)
Elastic ViTs from Pretrained Models without Retraining
por: Simoncini, Walter, et al.
Publicado: (2025)
por: Simoncini, Walter, et al.
Publicado: (2025)
Redefining Normal: A Novel Object-Level Approach for Multi-Object Novelty Detection
por: Salehi, Mohammadreza, et al.
Publicado: (2024)
por: Salehi, Mohammadreza, et al.
Publicado: (2024)
Lost in Time: A New Temporal Benchmark for VideoLLMs
por: Cores, Daniel, et al.
Publicado: (2024)
por: Cores, Daniel, et al.
Publicado: (2024)
SIGMA: Sinkhorn-Guided Masked Video Modeling
por: Salehi, Mohammadreza, et al.
Publicado: (2024)
por: Salehi, Mohammadreza, et al.
Publicado: (2024)
SelEx: Self-Expertise in Fine-Grained Generalized Category Discovery
por: Rastegar, Sarah, et al.
Publicado: (2024)
por: Rastegar, Sarah, et al.
Publicado: (2024)
Commonsense Video Question Answering through Video-Grounded Entailment Tree Reasoning
por: Liu, Huabin, et al.
Publicado: (2025)
por: Liu, Huabin, et al.
Publicado: (2025)
Training-Free Semantic Segmentation via LLM-Supervision
por: Sun, Wenfang, et al.
Publicado: (2024)
por: Sun, Wenfang, et al.
Publicado: (2024)
GeneralAD: Anomaly Detection Across Domains by Attending to Distorted Features
por: Sträter, Luc P. J., et al.
Publicado: (2024)
por: Sträter, Luc P. J., et al.
Publicado: (2024)
MoSiC: Optimal-Transport Motion Trajectory for Dense Self-Supervised Learning
por: Salehi, Mohammadreza, et al.
Publicado: (2025)
por: Salehi, Mohammadreza, et al.
Publicado: (2025)
FVO: Fast Visual Odometry with Transformers
por: Yugay, Vlardimir, et al.
Publicado: (2025)
por: Yugay, Vlardimir, et al.
Publicado: (2025)
Structured-Noise Masked Modeling for Video, Audio and Beyond
por: Bhowmik, Aritra, et al.
Publicado: (2025)
por: Bhowmik, Aritra, et al.
Publicado: (2025)
LocoMotion: Learning Motion-Focused Video-Language Representations
por: Doughty, Hazel, et al.
Publicado: (2024)
por: Doughty, Hazel, et al.
Publicado: (2024)
RegionReasoner: Region-Grounded Multi-Round Visual Reasoning
por: Sun, Wenfang, et al.
Publicado: (2026)
por: Sun, Wenfang, et al.
Publicado: (2026)
Private PoEtry: Private In-Context Learning via Product of Experts
por: Romijnders, Rob, et al.
Publicado: (2026)
por: Romijnders, Rob, et al.
Publicado: (2026)
Low-Resource Vision Challenges for Foundation Models
por: Zhang, Yunhua, et al.
Publicado: (2024)
por: Zhang, Yunhua, et al.
Publicado: (2024)
What Layers When: Learning to Skip Compute in LLMs with Residual Gates
por: Laitenberger, Filipe, et al.
Publicado: (2025)
por: Laitenberger, Filipe, et al.
Publicado: (2025)
An Image is Worth More Than 16x16 Patches: Exploring Transformers on Individual Pixels
por: Nguyen, Duy-Kien, et al.
Publicado: (2024)
por: Nguyen, Duy-Kien, et al.
Publicado: (2024)
IPO: Interpretable Prompt Optimization for Vision-Language Models
por: Du, Yingjun, et al.
Publicado: (2024)
por: Du, Yingjun, et al.
Publicado: (2024)
R-MAE: Regions Meet Masked Autoencoders
por: Nguyen, Duy-Kien, et al.
Publicado: (2023)
por: Nguyen, Duy-Kien, et al.
Publicado: (2023)
Purrception: Variational Flow Matching for Vector-Quantized Image Generation
por: Matişan, Răzvan-Andrei, et al.
Publicado: (2025)
por: Matişan, Răzvan-Andrei, et al.
Publicado: (2025)
Auto-Vocabulary Semantic Segmentation
por: Ülger, Osman, et al.
Publicado: (2023)
por: Ülger, Osman, et al.
Publicado: (2023)
Dual Guidance Semi-Supervised Action Detection
por: Singh, Ankit, et al.
Publicado: (2025)
por: Singh, Ankit, et al.
Publicado: (2025)
SuperDisco: Super-Class Discovery Improves Visual Recognition for the Long-Tail
por: Du, Yingjun, et al.
Publicado: (2023)
por: Du, Yingjun, et al.
Publicado: (2023)
GAP3D: Generative Alignment of VLM Latents to Patch-Level Embeddings for 3D Generation
por: Gkotsi, Polytimi Anna, et al.
Publicado: (2026)
por: Gkotsi, Polytimi Anna, et al.
Publicado: (2026)
Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMs
por: Wang, Ziqi, et al.
Publicado: (2025)
por: Wang, Ziqi, et al.
Publicado: (2025)
Beyond Coarse-Grained Matching in Video-Text Retrieval
por: Chen, Aozhu, et al.
Publicado: (2024)
por: Chen, Aozhu, et al.
Publicado: (2024)
Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection
por: Salehi, Alireza, et al.
Publicado: (2025)
por: Salehi, Alireza, et al.
Publicado: (2025)
Learn to Categorize or Categorize to Learn? Self-Coding for Generalized Category Discovery
por: Rastegar, Sarah, et al.
Publicado: (2023)
por: Rastegar, Sarah, et al.
Publicado: (2023)
The Sound of Water: Inferring Physical Properties from Pouring Liquids
por: Bagad, Piyush, et al.
Publicado: (2024)
por: Bagad, Piyush, et al.
Publicado: (2024)
Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning
por: Zeng, Zhen, et al.
Publicado: (2025)
por: Zeng, Zhen, et al.
Publicado: (2025)
QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain
por: Sun, Wenfang, et al.
Publicado: (2024)
por: Sun, Wenfang, et al.
Publicado: (2024)
Ejemplares similares
-
Union-over-Intersections: Object Detection beyond Winner-Takes-All
por: Bhowmik, Aritra, et al.
Publicado: (2023) -
TULIP: Token-length Upgraded CLIP
por: Najdenkoska, Ivona, et al.
Publicado: (2024) -
NeoBabel: A Multilingual Open Tower for Visual Generation
por: Derakhshani, Mohammad Mahdi, et al.
Publicado: (2025) -
Any-Shift Prompting for Generalization over Distributions
por: Xiao, Zehao, et al.
Publicado: (2024) -
MoAlign: Motion-Centric Representation Alignment for Video Diffusion Models
por: Bhowmik, Aritra, et al.
Publicado: (2025)