How Far Are We from Intelligent Visual Deductive Reasoning?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Yizhe, Bai, He, Zhang, Ruixiang, Gu, Jiatao, Zhai, Shuangfei, Susskind, Josh, Jaitly, Navdeep |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Matryoshka Diffusion Models
par: Gu, Jiatao, et autres
Publié: (2023)
par: Gu, Jiatao, et autres
Publié: (2023)
Improving GFlowNets for Text-to-Image Diffusion Alignment
par: Zhang, Dinghuai, et autres
Publié: (2024)
par: Zhang, Dinghuai, et autres
Publié: (2024)
TypeScore: A Text Fidelity Metric for Text-to-Image Generative Models
par: Sampaio, Georgia Gabriela, et autres
Publié: (2024)
par: Sampaio, Georgia Gabriela, et autres
Publié: (2024)
Kaleido Diffusion: Improving Conditional Diffusion Models with Autoregressive Latent Modeling
par: Gu, Jiatao, et autres
Publié: (2024)
par: Gu, Jiatao, et autres
Publié: (2024)
DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation
par: Gu, Jiatao, et autres
Publié: (2024)
par: Gu, Jiatao, et autres
Publié: (2024)
PLANNER: Generating Diversified Paragraph via Latent Language Diffusion Model
par: Zhang, Yizhe, et autres
Publié: (2023)
par: Zhang, Yizhe, et autres
Publié: (2023)
Normalizing Flows are Capable Generative Models
par: Zhai, Shuangfei, et autres
Publié: (2024)
par: Zhai, Shuangfei, et autres
Publié: (2024)
Many-to-many Image Generation with Auto-regressive Diffusion Models
par: Shen, Ying, et autres
Publié: (2024)
par: Shen, Ying, et autres
Publié: (2024)
Flexible Language Modeling in Continuous Space with Transformer-based Autoregressive Flows
par: Zhang, Ruixiang, et autres
Publié: (2025)
par: Zhang, Ruixiang, et autres
Publié: (2025)
Normalizing Trajectory Models
par: Gu, Jiatao, et autres
Publié: (2026)
par: Gu, Jiatao, et autres
Publié: (2026)
Normalizing Flows with Iterative Denoising
par: Chen, Tianrong, et autres
Publié: (2026)
par: Chen, Tianrong, et autres
Publié: (2026)
World-consistent Video Diffusion with Explicit 3D Modeling
par: Zhang, Qihang, et autres
Publié: (2024)
par: Zhang, Qihang, et autres
Publié: (2024)
STARFlow: Scaling Latent Normalizing Flows for High-resolution Image Synthesis
par: Gu, Jiatao, et autres
Publié: (2025)
par: Gu, Jiatao, et autres
Publié: (2025)
Aggregate-and-Adapt Natural Language Prompts for Downstream Generalization of CLIP
par: Huang, Chen, et autres
Publié: (2024)
par: Huang, Chen, et autres
Publié: (2024)
STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal Generation
par: Shen, Ying, et autres
Publié: (2026)
par: Shen, Ying, et autres
Publié: (2026)
How Far Are We from Generating Missing Modalities with Foundation Models?
par: Ke, Guanzhou, et autres
Publié: (2025)
par: Ke, Guanzhou, et autres
Publié: (2025)
The Coupling Within: Flow Matching via Distilled Normalizing Flows
par: Berthelot, David, et autres
Publié: (2026)
par: Berthelot, David, et autres
Publié: (2026)
DiffuCoder: Understanding and Improving Masked Diffusion Models for Code Generation
par: Gong, Shansan, et autres
Publié: (2025)
par: Gong, Shansan, et autres
Publié: (2025)
PixelWorld: How Far Are We from Perceiving Everything as Pixels?
par: Lyu, Zhiheng, et autres
Publié: (2025)
par: Lyu, Zhiheng, et autres
Publié: (2025)
STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows
par: Gu, Jiatao, et autres
Publié: (2025)
par: Gu, Jiatao, et autres
Publié: (2025)
What Makes the Preferred Thinking Direction for LLMs in Multiple-choice Questions?
par: Zhang, Yizhe, et autres
Publié: (2025)
par: Zhang, Yizhe, et autres
Publié: (2025)
SAGE: Steering Dialog Generation with Future-Aware State-Action Augmentation
par: Zhang, Yizhe, et autres
Publié: (2025)
par: Zhang, Yizhe, et autres
Publié: (2025)
Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification
par: Bai, Tianyi, et autres
Publié: (2025)
par: Bai, Tianyi, et autres
Publié: (2025)
Embarrassingly Simple Self-Distillation Improves Code Generation
par: Zhang, Ruixiang, et autres
Publié: (2026)
par: Zhang, Ruixiang, et autres
Publié: (2026)
Divide-or-Conquer? Which Part Should You Distill Your LLM?
par: Wu, Zhuofeng, et autres
Publié: (2024)
par: Wu, Zhuofeng, et autres
Publié: (2024)
Benchmarking and Improving Large Vision-Language Models for Fundamental Visual Graph Understanding and Reasoning
par: Zhu, Yingjie, et autres
Publié: (2024)
par: Zhu, Yingjie, et autres
Publié: (2024)
Omni-o3: Deep Nested Omnimodal Deduction for Deliberative Audio-Visual Reasoning
par: Zhang, Zhicheng, et autres
Publié: (2026)
par: Zhang, Zhicheng, et autres
Publié: (2026)
Composition-Grounded Data Synthesis for Visual Reasoning
par: Gu, Xinyi, et autres
Publié: (2025)
par: Gu, Xinyi, et autres
Publié: (2025)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
par: Jiang, Ruixiang, et autres
Publié: (2025)
par: Jiang, Ruixiang, et autres
Publié: (2025)
Visually Guided Generative Text-Layout Pre-training for Document Intelligence
par: Mao, Zhiming, et autres
Publié: (2024)
par: Mao, Zhiming, et autres
Publié: (2024)
Latent Sketchpad: Sketching Visual Thoughts to Elicit Multimodal Reasoning in MLLMs
par: Zhang, Huanyu, et autres
Publié: (2025)
par: Zhang, Huanyu, et autres
Publié: (2025)
Embodied-Reasoner: Synergizing Visual Search, Reasoning, and Action for Embodied Interactive Tasks
par: Zhang, Wenqi, et autres
Publié: (2025)
par: Zhang, Wenqi, et autres
Publié: (2025)
Open Vision Reasoner: Transferring Linguistic Cognitive Behavior for Visual Reasoning
par: Wei, Yana, et autres
Publié: (2025)
par: Wei, Yana, et autres
Publié: (2025)
How Far Are Vision-Language Models from Constructing the Real World? A Benchmark for Physical Generative Reasoning
par: Yang, Luyu, et autres
Publié: (2026)
par: Yang, Luyu, et autres
Publié: (2026)
Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?
par: Wen, Zichen, et autres
Publié: (2025)
par: Wen, Zichen, et autres
Publié: (2025)
Latent Visual Reasoning
par: Li, Bangzheng, et autres
Publié: (2025)
par: Li, Bangzheng, et autres
Publié: (2025)
Forest Before Trees: Latent Superposition for Efficient Visual Reasoning
par: Wang, Yubo, et autres
Publié: (2026)
par: Wang, Yubo, et autres
Publié: (2026)
CLaRa: Bridging Retrieval and Generation with Continuous Latent Reasoning
par: He, Jie, et autres
Publié: (2025)
par: He, Jie, et autres
Publié: (2025)
How Far Are Video Models from True Multimodal Reasoning?
par: Zhang, Xiaotian, et autres
Publié: (2026)
par: Zhang, Xiaotian, et autres
Publié: (2026)
Probing the Multi-turn Planning Capabilities of LLMs via 20 Question Games
par: Zhang, Yizhe, et autres
Publié: (2023)
par: Zhang, Yizhe, et autres
Publié: (2023)
Documents similaires
-
Matryoshka Diffusion Models
par: Gu, Jiatao, et autres
Publié: (2023) -
Improving GFlowNets for Text-to-Image Diffusion Alignment
par: Zhang, Dinghuai, et autres
Publié: (2024) -
TypeScore: A Text Fidelity Metric for Text-to-Image Generative Models
par: Sampaio, Georgia Gabriela, et autres
Publié: (2024) -
Kaleido Diffusion: Improving Conditional Diffusion Models with Autoregressive Latent Modeling
par: Gu, Jiatao, et autres
Publié: (2024) -
DART: Denoising Autoregressive Transformer for Scalable Text-to-Image Generation
par: Gu, Jiatao, et autres
Publié: (2024)