Jack of All Tasks, Master of Many: Designing General-purpose Coarse-to-Fine Vision-Language Model
Fuente:
arXiv
Saved in:
| Main Authors: | Pramanick, Shraman, Han, Guangxing, Hou, Rui, Nag, Sayan, Lim, Ser-Nam, Ballas, Nicolas, Wang, Qifan, Chellappa, Rama, Almahairi, Amjad |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
by: Pramanick, Shraman, et al.
Published: (2024)
by: Pramanick, Shraman, et al.
Published: (2024)
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
by: Pramanick, Shraman, et al.
Published: (2025)
by: Pramanick, Shraman, et al.
Published: (2025)
SciFig: Towards Automating Scientific Figure Generation
by: Huang, Siyuan, et al.
Published: (2026)
by: Huang, Siyuan, et al.
Published: (2026)
Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning
by: Park, Dongmin, et al.
Published: (2024)
by: Park, Dongmin, et al.
Published: (2024)
ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models
by: Wei, Guoyizhe, et al.
Published: (2025)
by: Wei, Guoyizhe, et al.
Published: (2025)
DetailCLIP: Detail-Oriented CLIP for Fine-Grained Tasks
by: Monsefi, Amin Karimi, et al.
Published: (2024)
by: Monsefi, Amin Karimi, et al.
Published: (2024)
Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning
by: Chen, Harold Haodong, et al.
Published: (2024)
by: Chen, Harold Haodong, et al.
Published: (2024)
Towards Chunk-Wise Generation for Long Videos
by: Zhang, Siyang, et al.
Published: (2024)
by: Zhang, Siyang, et al.
Published: (2024)
Template-based Multi-Domain Face Recognition
by: Nanduri, Anirudh, et al.
Published: (2024)
by: Nanduri, Anirudh, et al.
Published: (2024)
DiffInf: Influence-Guided Diffusion for Supervision Alignment in Facial Attribute Learning
by: Pal, Basudha, et al.
Published: (2026)
by: Pal, Basudha, et al.
Published: (2026)
MimicGait: A Model Agnostic approach for Occluded Gait Recognition using Correlational Knowledge Distillation
by: Gupta, Ayush, et al.
Published: (2025)
by: Gupta, Ayush, et al.
Published: (2025)
CLR-Face: Conditional Latent Refinement for Blind Face Restoration Using Score-Based Diffusion Models
by: Suin, Maitreya, et al.
Published: (2024)
by: Suin, Maitreya, et al.
Published: (2024)
Learning to Prompt Your Domain for Vision-Language Models
by: Wei, Guoyizhe, et al.
Published: (2023)
by: Wei, Guoyizhe, et al.
Published: (2023)
Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation
by: Chen, Harold Haodong, et al.
Published: (2025)
by: Chen, Harold Haodong, et al.
Published: (2025)
VideoMerge: Towards Training-free Long Video Generation
by: Zhang, Siyang, et al.
Published: (2025)
by: Zhang, Siyang, et al.
Published: (2025)
Video Decomposition Prior: A Methodology to Decompose Videos into Layers
by: Shrivastava, Gaurav, et al.
Published: (2024)
by: Shrivastava, Gaurav, et al.
Published: (2024)
FLAME: Adaptive Mixture-of-Experts for Continual Multimodal Multi-Task Learning
by: Han, Xing, et al.
Published: (2026)
by: Han, Xing, et al.
Published: (2026)
DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness
by: Mohammadshirazi, Ahmad, et al.
Published: (2024)
by: Mohammadshirazi, Ahmad, et al.
Published: (2024)
A Quantitative Evaluation of the Expressivity of BMI, Pose and Gender in Body Embeddings for Recognition and Identification
by: Pal, Basudha, et al.
Published: (2025)
by: Pal, Basudha, et al.
Published: (2025)
Zero-Shot Personalization of Objects via Textual Inversion
by: Roy, Aniket, et al.
Published: (2026)
by: Roy, Aniket, et al.
Published: (2026)
FusionRF: High-Fidelity Satellite Neural Radiance Fields from Multispectral and Panchromatic Acquisitions
by: Sprintson, Michael, et al.
Published: (2024)
by: Sprintson, Michael, et al.
Published: (2024)
Mind the Gap: Bridging Occlusion in Gait Recognition via Residual Gap Correction
by: Gupta, Ayush, et al.
Published: (2025)
by: Gupta, Ayush, et al.
Published: (2025)
Encoding of Demographic and Anatomical Information in Chest X-Ray-based Severe Left Ventricular Hypertrophy Classifiers
by: Pal, Basudha, et al.
Published: (2025)
by: Pal, Basudha, et al.
Published: (2025)
Cross-Spectral Body Recognition with Side Information Embedding: Benchmarks on LLCM and Analyzing Range-Induced Occlusions on IJB-MDF
by: Nanduri, Anirudh, et al.
Published: (2025)
by: Nanduri, Anirudh, et al.
Published: (2025)
Multi-Domain Biometric Recognition using Body Embeddings
by: Nanduri, Anirudh, et al.
Published: (2025)
by: Nanduri, Anirudh, et al.
Published: (2025)
Jack of All Trades, Master of Some, a Multi-Purpose Transformer Agent
by: Gallouédec, Quentin, et al.
Published: (2024)
by: Gallouédec, Quentin, et al.
Published: (2024)
Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models
by: Jang, Young Kyun, et al.
Published: (2024)
by: Jang, Young Kyun, et al.
Published: (2024)
DiffRegCD: Integrated Registration and Change Detection with Diffusion Features
by: Madani, Seyedehanita, et al.
Published: (2025)
by: Madani, Seyedehanita, et al.
Published: (2025)
AirSketch: Generative Motion to Sketch
by: Lim, Hui Xian Grace, et al.
Published: (2024)
by: Lim, Hui Xian Grace, et al.
Published: (2024)
LASER: A Neuro-Symbolic Framework for Learning Spatial-Temporal Scene Graphs with Weak Supervision
by: Huang, Jiani, et al.
Published: (2023)
by: Huang, Jiani, et al.
Published: (2023)
DreamMask: Boosting Open-vocabulary Panoptic Segmentation with Synthetic Data
by: Tu, Yuanpeng, et al.
Published: (2025)
by: Tu, Yuanpeng, et al.
Published: (2025)
Towards Unified 3D Object Detection via Algorithm and Data Unification
by: Li, Zhuoling, et al.
Published: (2024)
by: Li, Zhuoling, et al.
Published: (2024)
Composing Object Relations and Attributes for Image-Text Matching
by: Pham, Khoi, et al.
Published: (2024)
by: Pham, Khoi, et al.
Published: (2024)
Fast Encoding and Decoding for Implicit Video Representation
by: Chen, Hao, et al.
Published: (2024)
by: Chen, Hao, et al.
Published: (2024)
Scene Co-pilot: Procedural Text to Video Generation with Human in the Loop
by: Qian, Zhaofang, et al.
Published: (2024)
by: Qian, Zhaofang, et al.
Published: (2024)
Delta Activations: A Representation for Finetuned Large Language Models
by: Xu, Zhiqiu, et al.
Published: (2025)
by: Xu, Zhiqiu, et al.
Published: (2025)
DisjunctiveNet: Neural Symbolic Learning via Differentiable Convexified Optimization Layers
by: Pal, Shraman, et al.
Published: (2026)
by: Pal, Shraman, et al.
Published: (2026)
Distilling Vision-Language Pretraining for Efficient Cross-Modal Retrieval
by: Jang, Young Kyun, et al.
Published: (2024)
by: Jang, Young Kyun, et al.
Published: (2024)
AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning
by: Galougah, Siminfar Samakoush, et al.
Published: (2025)
by: Galougah, Siminfar Samakoush, et al.
Published: (2025)
An $O(n \log n)$-Time Approximation Scheme for Geometric Many-to-Many Matching
by: Bandyapadhyay, Sayan, et al.
Published: (2024)
by: Bandyapadhyay, Sayan, et al.
Published: (2024)
Similar Items
-
SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers
by: Pramanick, Shraman, et al.
Published: (2024) -
Enrich and Detect: Video Temporal Grounding with Multimodal LLMs
by: Pramanick, Shraman, et al.
Published: (2025) -
SciFig: Towards Automating Scientific Figure Generation
by: Huang, Siyuan, et al.
Published: (2026) -
Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning
by: Park, Dongmin, et al.
Published: (2024) -
ViT-Linearizer: Distilling Quadratic Knowledge into Linear-Time Vision Models
by: Wei, Guoyizhe, et al.
Published: (2025)