Best of Both Worlds: Multimodal Reasoning and Generation via Unified Discrete Flow Matching
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Susladkar, Onkar, Prakash, Tushar, Deshmukh, Gayatri, Nguyen, Kiet A., Zhang, Jiaxun, Juvekar, Adheesh, Bao, Tianshu, Chai, Lin, Mittal, Sparsh, Dhillon, Inderjit S, Lourentzou, Ismini |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
par: Susladkar, Onkar, et autres
Publié: (2026)
par: Susladkar, Onkar, et autres
Publié: (2026)
D2Styler: Advancing Arbitrary Style Transfer with Discrete Diffusion Methods
par: Susladkar, Onkar, et autres
Publié: (2024)
par: Susladkar, Onkar, et autres
Publié: (2024)
CALICO: Part-Focused Semantic Co-Segmentation with Large Vision-Language Models
par: Nguyen, Kiet A., et autres
Publié: (2024)
par: Nguyen, Kiet A., et autres
Publié: (2024)
RewardFlow: Generate Images by Optimizing What You Reward
par: Susladkar, Onkar, et autres
Publié: (2026)
par: Susladkar, Onkar, et autres
Publié: (2026)
Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination
par: Li, Xinzhuo, et autres
Publié: (2025)
par: Li, Xinzhuo, et autres
Publié: (2025)
Uncertainty in Action: Confidence Elicitation in Embodied Agents
par: Yu, Tianjiao, et autres
Publié: (2025)
par: Yu, Tianjiao, et autres
Publié: (2025)
Historic Scripts to Modern Vision: A Novel Dataset and A VLM Framework for Transliteration of Modi Script to Devanagari
par: Kausadikar, Harshal, et autres
Publié: (2025)
par: Kausadikar, Harshal, et autres
Publié: (2025)
MotionAura: Generating High-Quality and Motion Consistent Videos using Discrete Diffusion
par: Susladkar, Onkar, et autres
Publié: (2024)
par: Susladkar, Onkar, et autres
Publié: (2024)
PRIMA: Multi-Image Vision-Language Models for Reasoning Segmentation
par: Wahed, Muntasir, et autres
Publié: (2024)
par: Wahed, Muntasir, et autres
Publié: (2024)
ViCTr: Vital Consistency Transfer for Pathology Aware Image Synthesis
par: Susladkar, Onkar, et autres
Publié: (2025)
par: Susladkar, Onkar, et autres
Publié: (2025)
Dressing the Imagination: A Dataset for AI-Powered Translation of Text into Fashion Outfits and A Novel NeRA Adapter for Enhanced Feature Adaptation
par: Deshmukh, Gayatri, et autres
Publié: (2024)
par: Deshmukh, Gayatri, et autres
Publié: (2024)
Commonsense for Zero-Shot Natural Language Video Localization
par: Holla, Meghana, et autres
Publié: (2023)
par: Holla, Meghana, et autres
Publié: (2023)
Bahasa Harmony: A Comprehensive Dataset for Bahasa Text-to-Speech Synthesis with Discrete Codec Modeling of EnGen-TTS
par: Susladkar, Onkar Kishor, et autres
Publié: (2024)
par: Susladkar, Onkar Kishor, et autres
Publié: (2024)
ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization
par: Patel, Nirmal, et autres
Publié: (2026)
par: Patel, Nirmal, et autres
Publié: (2026)
Geometric Median (GM) Matching for Robust Data Pruning
par: Acharya, Anish, et autres
Publié: (2024)
par: Acharya, Anish, et autres
Publié: (2024)
3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding
par: Ogunleye, Makanjuola, et autres
Publié: (2026)
par: Ogunleye, Makanjuola, et autres
Publié: (2026)
mTSBench: Benchmarking Multivariate Time Series Anomaly Detection and Model Selection at Scale
par: Zhou, Xiaona, et autres
Publié: (2025)
par: Zhou, Xiaona, et autres
Publié: (2025)
Part$^{2}$GS: Part-aware Modeling of Articulated Objects using 3D Gaussian Splatting
par: Yu, Tianjiao, et autres
Publié: (2025)
par: Yu, Tianjiao, et autres
Publié: (2025)
MMPlanner: Zero-Shot Multimodal Procedural Planning with Chain-of-Thought Object State Reasoning
par: Tabassum, Afrina, et autres
Publié: (2025)
par: Tabassum, Afrina, et autres
Publié: (2025)
LASER: Attention with Exponential Transformation
par: Duvvuri, Sai Surya, et autres
Publié: (2024)
par: Duvvuri, Sai Surya, et autres
Publié: (2024)
Hierarchical Dataset Selection for High-Quality Data Sharing
par: Zhou, Xiaona, et autres
Publié: (2025)
par: Zhou, Xiaona, et autres
Publié: (2025)
FAIR: Facilitating Artificial Intelligence Resilience in Manufacturing Industrial Internet
par: Zeng, Yingyan, et autres
Publié: (2025)
par: Zeng, Yingyan, et autres
Publié: (2025)
RAVEL: Rare Concept Generation and Editing via Graph-driven Relational Guidance
par: Venkatesh, Kavana, et autres
Publié: (2024)
par: Venkatesh, Kavana, et autres
Publié: (2024)
ELBA: Learning by Asking for Embodied Visual Navigation and Task Completion
par: Shen, Ying, et autres
Publié: (2023)
par: Shen, Ying, et autres
Publié: (2023)
Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics
par: Shen, Ying, et autres
Publié: (2026)
par: Shen, Ying, et autres
Publié: (2026)
Geometric Median Matching for Robust k-Subset Selection from Noisy Data
par: Acharya, Anish, et autres
Publié: (2025)
par: Acharya, Anish, et autres
Publié: (2025)
Comparison of Machine Learning Approaches for Classifying Spinodal Events
par: Malviya, Ashwini, et autres
Publié: (2024)
par: Malviya, Ashwini, et autres
Publié: (2024)
EHI: End-to-end Learning of Hierarchical Index for Efficient Dense Retrieval
par: Kumar, Ramnath, et autres
Publié: (2023)
par: Kumar, Ramnath, et autres
Publié: (2023)
MOCHA: Are Code Language Models Robust Against Multi-Turn Malicious Coding Prompts?
par: Wahed, Muntasir, et autres
Publié: (2025)
par: Wahed, Muntasir, et autres
Publié: (2025)
Best of Both Worlds Guarantees for Equitable Allocations
par: Bhaskar, Umang, et autres
Publié: (2025)
par: Bhaskar, Umang, et autres
Publié: (2025)
uaMix-MAE: Efficient Tuning of Pretrained Audio Transformers with Unsupervised Audio Mixtures
par: Tabassum, Afrina, et autres
Publié: (2024)
par: Tabassum, Afrina, et autres
Publié: (2024)
Tiny but Trusted: Efficient Vision-Language Reasoning for Time-Series Anomaly Detection
par: Zhou, Xiaona, et autres
Publié: (2026)
par: Zhou, Xiaona, et autres
Publié: (2026)
CoRe3D: Collaborative Reasoning as a Foundation for 3D Intelligence
par: Yu, Tianjiao, et autres
Publié: (2025)
par: Yu, Tianjiao, et autres
Publié: (2025)
Towards Quantifying the Preconditioning Effect of Adam
par: Das, Rudrajit, et autres
Publié: (2024)
par: Das, Rudrajit, et autres
Publié: (2024)
Hybrid Quantum Neural Network based Indoor User Localization using Cloud Quantum Computing
par: Mittal, Sparsh, et autres
Publié: (2024)
par: Mittal, Sparsh, et autres
Publié: (2024)
LUCID: Attention with Preconditioned Representations
par: Duvvuri, Sai Surya, et autres
Publié: (2026)
par: Duvvuri, Sai Surya, et autres
Publié: (2026)
Scientific Workflow Scheduling in Cloud Considering Cold Start and Variable Pricing Model
par: Sarkar, Suvarthi, et autres
Publié: (2025)
par: Sarkar, Suvarthi, et autres
Publié: (2025)
Rethinking Intermediate Layers design in Knowledge Distillation for Kidney and Liver Tumor Segmentation
par: Gorade, Vandan, et autres
Publié: (2023)
par: Gorade, Vandan, et autres
Publié: (2023)
Hierarchical Document Parsing via Large Margin Feature Matching and Heuristics
par: Kiet, Duong Anh
Publié: (2025)
par: Kiet, Duong Anh
Publié: (2025)
A Best-of-Both Approach to Improve Match Predictions and Reciprocal Recommendations for Job Search
par: Goda, Shuhei, et autres
Publié: (2024)
par: Goda, Shuhei, et autres
Publié: (2024)
Documents similaires
-
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
par: Susladkar, Onkar, et autres
Publié: (2026) -
D2Styler: Advancing Arbitrary Style Transfer with Discrete Diffusion Methods
par: Susladkar, Onkar, et autres
Publié: (2024) -
CALICO: Part-Focused Semantic Co-Segmentation with Large Vision-Language Models
par: Nguyen, Kiet A., et autres
Publié: (2024) -
RewardFlow: Generate Images by Optimizing What You Reward
par: Susladkar, Onkar, et autres
Publié: (2026) -
Counterfactual Segmentation Reasoning: Diagnosing and Mitigating Pixel-Grounding Hallucination
par: Li, Xinzhuo, et autres
Publié: (2025)