ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Chitty-Venkata, Krishna Teja, Emani, Murali |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
Beyond ImageNet: Understanding Cross-Dataset Robustness of Lightweight Vision Models
by: Zhang, Weidong, et al.
Published: (2025)
by: Zhang, Weidong, et al.
Published: (2025)
MoPEQ: Mixture of Mixed Precision Quantized Experts
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
Accessing Vision Foundation Models via ImageNet-1K
by: Zhang, Yitian, et al.
Published: (2024)
by: Zhang, Yitian, et al.
Published: (2024)
SOOD-ImageNet: a Large-Scale Dataset for Semantic Out-Of-Distribution Image Classification and Semantic Segmentation
by: Bacchin, Alberto, et al.
Published: (2024)
by: Bacchin, Alberto, et al.
Published: (2024)
Flaws of ImageNet, Computer Vision's Favourite Dataset
by: Kisel, Nikita, et al.
Published: (2024)
by: Kisel, Nikita, et al.
Published: (2024)
LExI: Layer-Adaptive Active Experts for Efficient MoE Model Inference
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
Scaling Up Deep Clustering Methods Beyond ImageNet-1K
by: Adaloglou, Nikolas, et al.
Published: (2024)
by: Adaloglou, Nikolas, et al.
Published: (2024)
Squeeze, Recover and Relabel: Dataset Condensation at ImageNet Scale From A New Perspective
by: Yin, Zeyuan, et al.
Published: (2023)
by: Yin, Zeyuan, et al.
Published: (2023)
Automated Classification of Model Errors on ImageNet
by: Peychev, Momchil, et al.
Published: (2023)
by: Peychev, Momchil, et al.
Published: (2023)
ImageNet-D: Benchmarking Neural Network Robustness on Diffusion Synthetic Object
by: Zhang, Chenshuang, et al.
Published: (2024)
by: Zhang, Chenshuang, et al.
Published: (2024)
ImageNot: A contrast with ImageNet preserves model rankings
by: Salaudeen, Olawale, et al.
Published: (2024)
by: Salaudeen, Olawale, et al.
Published: (2024)
What Makes ImageNet Look Unlike LAION
by: Shirali, Ali, et al.
Published: (2023)
by: Shirali, Ali, et al.
Published: (2023)
Can Biases in ImageNet Models Explain Generalization?
by: Gavrikov, Paul, et al.
Published: (2024)
by: Gavrikov, Paul, et al.
Published: (2024)
ConvNet vs Transformer, Supervised vs CLIP: Beyond ImageNet Accuracy
by: Vishniakov, Kirill, et al.
Published: (2023)
by: Vishniakov, Kirill, et al.
Published: (2023)
PreLoRA: Hybrid Pre-training of Vision Transformers with Full Training and Low-Rank Adapters
by: Thapa, Krishu K, et al.
Published: (2025)
by: Thapa, Krishu K, et al.
Published: (2025)
Speedrunning ImageNet Diffusion
by: Bhanded, Swayam
Published: (2025)
by: Bhanded, Swayam
Published: (2025)
Toward Errorless Training ImageNet-1k
by: Deng, Bo, et al.
Published: (2025)
by: Deng, Bo, et al.
Published: (2025)
Swimba: Switch Mamba Model Scales State Space Models
by: Du, Zhixu, et al.
Published: (2026)
by: Du, Zhixu, et al.
Published: (2026)
ImageNet-Patch: A Dataset for Benchmarking Machine Learning Robustness against Adversarial Patches
by: Pintor, Maura, et al.
Published: (2022)
by: Pintor, Maura, et al.
Published: (2022)
Babel-ImageNet: Massively Multilingual Evaluation of Vision-and-Language Representations
by: Geigle, Gregor, et al.
Published: (2023)
by: Geigle, Gregor, et al.
Published: (2023)
Unlocking ImageNet's Multi-Object Nature: Automated Large-Scale Multilabel Annotation
by: Chen, Junyu, et al.
Published: (2026)
by: Chen, Junyu, et al.
Published: (2026)
MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
Interpreting CLIP: Insights on the Robustness to ImageNet Distribution Shifts
by: Crabbé, Jonathan, et al.
Published: (2023)
by: Crabbé, Jonathan, et al.
Published: (2023)
Self-supervised Benchmark Lottery on ImageNet: Do Marginal Improvements Translate to Improvements on Similar Datasets?
by: Ozbulak, Utku, et al.
Published: (2025)
by: Ozbulak, Utku, et al.
Published: (2025)
CNN and ViT Efficiency Study on Tiny ImageNet and DermaMNIST Datasets
by: Amangeldi, Aidar, et al.
Published: (2025)
by: Amangeldi, Aidar, et al.
Published: (2025)
Large-Scale Data-Free Knowledge Distillation for ImageNet via Multi-Resolution Data Generation
by: Tran, Minh-Tuan, et al.
Published: (2024)
by: Tran, Minh-Tuan, et al.
Published: (2024)
VideoNet: A Large-Scale Dataset for Domain-Specific Action Recognition
by: Yadav, Tanush, et al.
Published: (2026)
by: Yadav, Tanush, et al.
Published: (2026)
Swin-UMamba: Mamba-based UNet with ImageNet-based pretraining
by: Liu, Jiarun, et al.
Published: (2024)
by: Liu, Jiarun, et al.
Published: (2024)
PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025)
Urban-ImageNet: A Large-Scale Multi-Modal Dataset and Evaluation Framework for Urban Space Perception
by: Ou, Yiwei, et al.
Published: (2026)
by: Ou, Yiwei, et al.
Published: (2026)
Simpler Diffusion (SiD2): 1.5 FID on ImageNet512 with pixel-space diffusion
by: Hoogeboom, Emiel, et al.
Published: (2024)
by: Hoogeboom, Emiel, et al.
Published: (2024)
From MNIST to ImageNet: Understanding the Scalability Boundaries of Differentiable Logic Gate Networks
by: Brändle, Sven, et al.
Published: (2025)
by: Brändle, Sven, et al.
Published: (2025)
BaKlaVa -- Budgeted Allocation of KV cache for Long-context Inference
by: Gulhan, Ahmed Burak, et al.
Published: (2025)
by: Gulhan, Ahmed Burak, et al.
Published: (2025)
StableSemantics: A Synthetic Language-Vision Dataset of Semantic Representations in Naturalistic Images
by: Zawar, Rushikesh, et al.
Published: (2024)
by: Zawar, Rushikesh, et al.
Published: (2024)
Efficiera Residual Networks: Hardware-Friendly Fully Binary Weight with 2-bit Activation Model Achieves Practical ImageNet Accuracy
by: Takahashi, Shuntaro, et al.
Published: (2024)
by: Takahashi, Shuntaro, et al.
Published: (2024)
Harnessing the Power of Large Vision Language Models for Synthetic Image Detection
by: Keita, Mamadou, et al.
Published: (2024)
by: Keita, Mamadou, et al.
Published: (2024)
Fine-Grained ImageNet Classification in the Wild
by: Lymperaiou, Maria, et al.
Published: (2023)
by: Lymperaiou, Maria, et al.
Published: (2023)
ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection
by: Huang, Tai-Ming, et al.
Published: (2025)
by: Huang, Tai-Ming, et al.
Published: (2025)
Spikformer V2: Join the High Accuracy Club on ImageNet with an SNN Ticket
by: Zhou, Zhaokun, et al.
Published: (2024)
by: Zhou, Zhaokun, et al.
Published: (2024)
Similar Items
-
LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025) -
Beyond ImageNet: Understanding Cross-Dataset Robustness of Lightweight Vision Models
by: Zhang, Weidong, et al.
Published: (2025) -
MoPEQ: Mixture of Mixed Precision Quantized Experts
by: Chitty-Venkata, Krishna Teja, et al.
Published: (2025) -
Accessing Vision Foundation Models via ImageNet-1K
by: Zhang, Yitian, et al.
Published: (2024) -
SOOD-ImageNet: a Large-Scale Dataset for Semantic Out-Of-Distribution Image Classification and Semantic Segmentation
by: Bacchin, Alberto, et al.
Published: (2024)