SMIR: Efficient Synthetic Data Pipeline To Improve Multi-Image Reasoning
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Andrew, Thapa, Rahul, Chalamala, Rahul, Wu, Qingyang, Chen, Kezhen, Zou, James |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
par: Thapa, Rahul, et autres
Publié: (2024)
par: Thapa, Rahul, et autres
Publié: (2024)
How Well Can General Vision-Language Models Learn Medicine By Watching Public Educational Videos?
par: Thapa, Rahul, et autres
Publié: (2025)
par: Thapa, Rahul, et autres
Publié: (2025)
OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning
par: Lu, Pan, et autres
Publié: (2025)
par: Lu, Pan, et autres
Publié: (2025)
A Sparse Graph Formulation for Efficient Spectral Image Segmentation
par: Palnitkar, Rahul, et autres
Publié: (2023)
par: Palnitkar, Rahul, et autres
Publié: (2023)
Mapping of Lesion Images to Somatic Mutations
par: Mehta, Rahul
Publié: (2025)
par: Mehta, Rahul
Publié: (2025)
Explanation-Aware Learning for Enhanced Interpretability in Biomedical Imaging
par: Faruqui, Zubair, et autres
Publié: (2026)
par: Faruqui, Zubair, et autres
Publié: (2026)
SatDepth: A Novel Dataset for Satellite Image Matching
par: Deshmukh, Rahul, et autres
Publié: (2025)
par: Deshmukh, Rahul, et autres
Publié: (2025)
Synthetic Simplicity: Unveiling Bias in Medical Data Augmentation
par: Babu, Krishan Agyakari Raja, et autres
Publié: (2024)
par: Babu, Krishan Agyakari Raja, et autres
Publié: (2024)
Start Small, Think Big: Curriculum-based Relative Policy Optimization for Visual Grounding
par: Yan, Qingyang, et autres
Publié: (2025)
par: Yan, Qingyang, et autres
Publié: (2025)
Auto-Generating Weak Labels for Real & Synthetic Data to Improve Label-Scarce Medical Image Segmentation
par: Deshpande, Tanvi, et autres
Publié: (2024)
par: Deshpande, Tanvi, et autres
Publié: (2024)
Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning
par: Zhang, Bob, et autres
Publié: (2025)
par: Zhang, Bob, et autres
Publié: (2025)
Improving Heart Rejection Detection in XPCI Images Using Synthetic Data Augmentation
par: Samardžija, Jakov, et autres
Publié: (2025)
par: Samardžija, Jakov, et autres
Publié: (2025)
Conformal Trajectory Prediction with Multi-View Data Integration in Cooperative Driving
par: Chen, Xi, et autres
Publié: (2024)
par: Chen, Xi, et autres
Publié: (2024)
Reflection Generation for Composite Image Using Diffusion Model
par: Zhao, Haonan, et autres
Publié: (2026)
par: Zhao, Haonan, et autres
Publié: (2026)
Improving Synthetic Image Detection Towards Generalization: An Image Transformation Perspective
par: Li, Ouxiang, et autres
Publié: (2024)
par: Li, Ouxiang, et autres
Publié: (2024)
ClueAegis: Heuristic-to-Reasoning Cognitive-skill Learning for Unified Evidence-based Synthetic Image Detection
par: Cao, Huangsen, et autres
Publié: (2026)
par: Cao, Huangsen, et autres
Publié: (2026)
Seg-HGNN: Unsupervised and Light-Weight Image Segmentation with Hyperbolic Graph Neural Networks
par: Mondal, Debjyoti, et autres
Publié: (2024)
par: Mondal, Debjyoti, et autres
Publié: (2024)
UAV-MM3D: A Large-Scale Synthetic Benchmark for 3D Perception of Unmanned Aerial Vehicles with Multi-Modal Data
par: Zou, Longkun, et autres
Publié: (2025)
par: Zou, Longkun, et autres
Publié: (2025)
EpiMask: Leveraging Epipolar Distance Based Masks in Cross-Attention for Satellite Image Matching
par: Deshmukh, Rahul, et autres
Publié: (2026)
par: Deshmukh, Rahul, et autres
Publié: (2026)
Beyond a Single Signal: SPECTREG2, A Unified MultiExpert Anomaly Detector for Unknown Unknowns
par: Ray, Rahul D
Publié: (2026)
par: Ray, Rahul D
Publié: (2026)
Chain of Functions: A Programmatic Pipeline for Fine-Grained Chart Reasoning Data
par: Li, Zijian, et autres
Publié: (2025)
par: Li, Zijian, et autres
Publié: (2025)
Leveraging Topological Guidance for Improved Knowledge Distillation
par: Jeon, Eun Som, et autres
Publié: (2024)
par: Jeon, Eun Som, et autres
Publié: (2024)
DELINE8K: A Synthetic Data Pipeline for the Semantic Segmentation of Historical Documents
par: Archibald, Taylor, et autres
Publié: (2024)
par: Archibald, Taylor, et autres
Publié: (2024)
Improving Text Generation on Images with Synthetic Captions
par: Koh, Jun Young, et autres
Publié: (2024)
par: Koh, Jun Young, et autres
Publié: (2024)
Efficient Multi-Crop Saliency Partitioning for Automatic Image Cropping
par: Hamara, Andrew, et autres
Publié: (2025)
par: Hamara, Andrew, et autres
Publié: (2025)
A Data Augmentation Pipeline to Generate Synthetic Labeled Datasets of 3D Echocardiography Images using a GAN
par: Tiago, Cristiana, et autres
Publié: (2024)
par: Tiago, Cristiana, et autres
Publié: (2024)
Backdoors in Conditional Diffusion: Threats to Responsible Synthetic Data Pipelines
par: Lapid, Raz, et autres
Publié: (2025)
par: Lapid, Raz, et autres
Publié: (2025)
DMCIE: Diffusion Model with Concatenation of Inputs and Errors to Improve the Accuracy of the Segmentation of Brain Tumors in MRI Images
par: Yavari, Sara, et autres
Publié: (2025)
par: Yavari, Sara, et autres
Publié: (2025)
A Synthetic Data Pipeline for Supporting Manufacturing SMEs in Visual Assembly Control
par: Werheid, Jonas, et autres
Publié: (2025)
par: Werheid, Jonas, et autres
Publié: (2025)
ChartM$^3$: A Multi-Stage Code-Driven Pipeline for Constructing Multi-Dimensional and Multi-Step Visual Reasoning Data in Chart Comprehension
par: Xu, Duo, et autres
Publié: (2025)
par: Xu, Duo, et autres
Publié: (2025)
Temporal-Anchor3DLane: Enhanced 3D Lane Detection with Multi-Task Losses and LSTM Fusion
par: Suhas, D. Shainu, et autres
Publié: (2025)
par: Suhas, D. Shainu, et autres
Publié: (2025)
Enhancing Visual Programming for Visual Reasoning via Probabilistic Graphs
par: Wan, Wentao, et autres
Publié: (2025)
par: Wan, Wentao, et autres
Publié: (2025)
HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models
par: Peng, Zelin, et autres
Publié: (2025)
par: Peng, Zelin, et autres
Publié: (2025)
VR-based generation of photorealistic synthetic data for training hand-object tracking models
par: Zhang, Chengyan, et autres
Publié: (2024)
par: Zhang, Chengyan, et autres
Publié: (2024)
A Data Efficiency Study of Synthetic Fog for Object Detection Using the Clear2Fog Pipeline
par: Mohamed, Mohamed Ahmed, et autres
Publié: (2026)
par: Mohamed, Mohamed Ahmed, et autres
Publié: (2026)
A Multi-Mode Structured Light 3D Imaging System with Multi-Source Information Fusion for Underwater Pipeline Detection
par: Hu, Qinghan, et autres
Publié: (2025)
par: Hu, Qinghan, et autres
Publié: (2025)
CCUP: A Controllable Synthetic Data Generation Pipeline for Pretraining Cloth-Changing Person Re-Identification Models
par: Zhao, Yujian, et autres
Publié: (2024)
par: Zhao, Yujian, et autres
Publié: (2024)
Synthetically Enhanced: Unveiling Synthetic Data's Potential in Medical Imaging Research
par: Khosravi, Bardia, et autres
Publié: (2023)
par: Khosravi, Bardia, et autres
Publié: (2023)
Improved Generation of Synthetic Imaging Data Using Feature-Aligned Diffusion
par: Nair, Lakshmi
Publié: (2024)
par: Nair, Lakshmi
Publié: (2024)
Unsupervised learning of Data-driven Facial Expression Coding System (DFECS) using keypoint tracking
par: Tripathi, Shivansh Chandra, et autres
Publié: (2024)
par: Tripathi, Shivansh Chandra, et autres
Publié: (2024)
Documents similaires
-
Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models
par: Thapa, Rahul, et autres
Publié: (2024) -
How Well Can General Vision-Language Models Learn Medicine By Watching Public Educational Videos?
par: Thapa, Rahul, et autres
Publié: (2025) -
OctoTools: An Agentic Framework with Extensible Tools for Complex Reasoning
par: Lu, Pan, et autres
Publié: (2025) -
A Sparse Graph Formulation for Efficient Spectral Image Segmentation
par: Palnitkar, Rahul, et autres
Publié: (2023) -
Mapping of Lesion Images to Somatic Mutations
par: Mehta, Rahul
Publié: (2025)