Organizing Unstructured Image Collections using Natural Language
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Mingxuan, Zhong, Zhun, Li, Jun, Franchi, Gianni, Roy, Subhankar, Ricci, Elisa |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Democratizing Fine-grained Visual Recognition with Large Language Models
by: Liu, Mingxuan, et al.
Published: (2024)
by: Liu, Mingxuan, et al.
Published: (2024)
Large-scale Pre-trained Models are Surprisingly Strong in Incremental Novel Class Discovery
by: Liu, Mingxuan, et al.
Published: (2023)
by: Liu, Mingxuan, et al.
Published: (2023)
How (Mis)calibrated is Your Federated CLIP and What To Do About It?
by: Singha, Mainak, et al.
Published: (2025)
by: Singha, Mainak, et al.
Published: (2025)
Ensembling Pruned Attention Heads For Uncertainty-Aware Efficient Transformers
by: Gabetni, Firas, et al.
Published: (2025)
by: Gabetni, Firas, et al.
Published: (2025)
Frustratingly Easy Test-Time Adaptation of Vision-Language Models
by: Farina, Matteo, et al.
Published: (2024)
by: Farina, Matteo, et al.
Published: (2024)
Unlearning Personal Data from a Single Image
by: De Min, Thomas, et al.
Published: (2024)
by: De Min, Thomas, et al.
Published: (2024)
ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models
by: De Min, Thomas, et al.
Published: (2026)
by: De Min, Thomas, et al.
Published: (2026)
Leveraging Visual Signals for Robust Token-Level Uncertainty in Vision-Language Generation
by: Hoche, Joseph, et al.
Published: (2026)
by: Hoche, Joseph, et al.
Published: (2026)
FedMVP: Federated Multimodal Visual Prompt Tuning for Vision-Language Models
by: Singha, Mainak, et al.
Published: (2025)
by: Singha, Mainak, et al.
Published: (2025)
LT-Soups: Bridging Head and Tail Classes via Subsampled Model Soups
by: Aminbeidokhti, Masih, et al.
Published: (2025)
by: Aminbeidokhti, Masih, et al.
Published: (2025)
Test-time Vocabulary Adaptation for Language-driven Object Detection
by: Liu, Mingxuan, et al.
Published: (2025)
by: Liu, Mingxuan, et al.
Published: (2025)
Less is more: Summarizing Patch Tokens for efficient Multi-Label Class-Incremental Learning
by: De Min, Thomas, et al.
Published: (2024)
by: De Min, Thomas, et al.
Published: (2024)
SHiNe: Semantic Hierarchy Nexus for Open-vocabulary Object Detection
by: Liu, Mingxuan, et al.
Published: (2024)
by: Liu, Mingxuan, et al.
Published: (2024)
Hierarchical Light Transformer Ensembles for Multimodal Trajectory Forecasting
by: Lafage, Adrien, et al.
Published: (2024)
by: Lafage, Adrien, et al.
Published: (2024)
CLIP-QDA: An Explainable Concept Bottleneck Model
by: Kazmierczak, Rémi, et al.
Published: (2023)
by: Kazmierczak, Rémi, et al.
Published: (2023)
SS3D: End2End Self-Supervised 3D from Web Videos
by: Hariat, Marwane, et al.
Published: (2026)
by: Hariat, Marwane, et al.
Published: (2026)
Explainability for Vision Foundation Models: A Survey
by: Kazmierczak, Rémi, et al.
Published: (2025)
by: Kazmierczak, Rémi, et al.
Published: (2025)
TDEdit: A Unified Diffusion Framework for Text-Drag Guided Image Manipulation
by: Wang, Qihang, et al.
Published: (2025)
by: Wang, Qihang, et al.
Published: (2025)
Multi-Scale Global-Instance Prompt Tuning for Continual Test-time Adaptation in Medical Image Segmentation
by: Li, Lingrui, et al.
Published: (2026)
by: Li, Lingrui, et al.
Published: (2026)
UrbanVerse: Scaling Urban Simulation by Watching City-Tour Videos
by: Liu, Mingxuan, et al.
Published: (2025)
by: Liu, Mingxuan, et al.
Published: (2025)
Enhancing Concept Localization in CLIP-based Concept Bottleneck Models
by: Kazmierczak, Rémi, et al.
Published: (2025)
by: Kazmierczak, Rémi, et al.
Published: (2025)
PAV: Personalized Head Avatar from Unstructured Video Collection
by: Caliskan, Akin, et al.
Published: (2024)
by: Caliskan, Akin, et al.
Published: (2024)
Learning Eigenstructures of Unstructured Data Manifolds
by: Velich, Roy, et al.
Published: (2025)
by: Velich, Roy, et al.
Published: (2025)
Prior-Constrained Association Learning for Fine-Grained Generalized Category Discovery
by: Wang, Menglin, et al.
Published: (2025)
by: Wang, Menglin, et al.
Published: (2025)
STEFANN: Scene Text Editor using Font Adaptive Neural Network
by: Roy, Prasun, et al.
Published: (2019)
by: Roy, Prasun, et al.
Published: (2019)
Memory Consistency Guided Divide-and-Conquer Learning for Generalized Category Discovery
by: Tu, Yuanpeng, et al.
Published: (2024)
by: Tu, Yuanpeng, et al.
Published: (2024)
3D Object Detection from Images for Autonomous Driving: A Survey
by: Ma, Xinzhu, et al.
Published: (2022)
by: Ma, Xinzhu, et al.
Published: (2022)
Semantically Consistent Person Image Generation
by: Roy, Prasun, et al.
Published: (2023)
by: Roy, Prasun, et al.
Published: (2023)
The Phantom Menace: Unmasking Privacy Leakages in Vision-Language Models
by: Caldarella, Simone, et al.
Published: (2024)
by: Caldarella, Simone, et al.
Published: (2024)
Training-Free Semantic Multi-Object Tracking with Vision-Language Models
by: Bonat, Laurence, et al.
Published: (2026)
by: Bonat, Laurence, et al.
Published: (2026)
Superpowering Open-Vocabulary Object Detectors for X-ray Vision
by: Garcia-Fernandez, Pablo, et al.
Published: (2025)
by: Garcia-Fernandez, Pablo, et al.
Published: (2025)
Room Scene Discovery and Grouping in Unstructured Vacation Rental Image Collections
by: Kappagantula, Vignesh Ram Nithin, et al.
Published: (2025)
by: Kappagantula, Vignesh Ram Nithin, et al.
Published: (2025)
A Geometric Unification of Concept Learning with Concept Cones
by: Rocchi--Henry, Alexandre, et al.
Published: (2025)
by: Rocchi--Henry, Alexandre, et al.
Published: (2025)
Scene Aware Person Image Generation through Global Contextual Conditioning
by: Roy, Prasun, et al.
Published: (2022)
by: Roy, Prasun, et al.
Published: (2022)
Towards Understanding and Quantifying Uncertainty for Text-to-Image Generation
by: Franchi, Gianni, et al.
Published: (2024)
by: Franchi, Gianni, et al.
Published: (2024)
From Local Geometry to Global Pseudo Labeling for Robust Positive Unlabeled Learning under Covariate Shift
by: Gabetni, Firas, et al.
Published: (2026)
by: Gabetni, Firas, et al.
Published: (2026)
EntityCLIP: Entity-Centric Image-Text Matching via Multimodal Attentive Contrastive Learning
by: Wang, Yaxiong, et al.
Published: (2024)
by: Wang, Yaxiong, et al.
Published: (2024)
MULTIFLOW: Shifting Towards Task-Agnostic Vision-Language Pruning
by: Farina, Matteo, et al.
Published: (2024)
by: Farina, Matteo, et al.
Published: (2024)
Match-and-Fuse: Consistent Generation from Unstructured Image Sets
by: Feingold, Kate, et al.
Published: (2025)
by: Feingold, Kate, et al.
Published: (2025)
Vocabulary-free Image Classification
by: Conti, Alessandro, et al.
Published: (2023)
by: Conti, Alessandro, et al.
Published: (2023)
Similar Items
-
Democratizing Fine-grained Visual Recognition with Large Language Models
by: Liu, Mingxuan, et al.
Published: (2024) -
Large-scale Pre-trained Models are Surprisingly Strong in Incremental Novel Class Discovery
by: Liu, Mingxuan, et al.
Published: (2023) -
How (Mis)calibrated is Your Federated CLIP and What To Do About It?
by: Singha, Mainak, et al.
Published: (2025) -
Ensembling Pruned Attention Heads For Uncertainty-Aware Efficient Transformers
by: Gabetni, Firas, et al.
Published: (2025) -
Frustratingly Easy Test-Time Adaptation of Vision-Language Models
by: Farina, Matteo, et al.
Published: (2024)