Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Qihao, Yin, Xi, Yuille, Alan, Brown, Andrew, Singh, Mannat |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DIRECT-3D: Learning Direct Text-to-3D Generation on Massive Noisy 3D Data
par: Liu, Qihao, et autres
Publié: (2024)
par: Liu, Qihao, et autres
Publié: (2024)
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
par: Xie, Yunfei, et autres
Publié: (2024)
par: Xie, Yunfei, et autres
Publié: (2024)
ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling
par: Liu, Qihao, et autres
Publié: (2025)
par: Liu, Qihao, et autres
Publié: (2025)
From Pixels and Words to Waves: A Unified Framework for Spectral Dictionary vLLMs
par: Kiruluta, Andrew, et autres
Publié: (2025)
par: Kiruluta, Andrew, et autres
Publié: (2025)
Computer Vision and Its Relationship to Cognitive Science: A perspective from Bayes Decision Theory
par: Yuille, Alan, et autres
Publié: (2026)
par: Yuille, Alan, et autres
Publié: (2026)
Differences That Matter: Auditing Models for Capability Gap Discovery and Rectification
par: Liu, Qihao, et autres
Publié: (2025)
par: Liu, Qihao, et autres
Publié: (2025)
Gaussian Scenes: Pose-Free Sparse-View Scene Reconstruction using Depth-Enhanced Diffusion Priors
par: Paul, Soumava, et autres
Publié: (2024)
par: Paul, Soumava, et autres
Publié: (2024)
TriDiff-4D: Fast 4D Generation through Diffusion-based Triplane Re-posing
par: Sheung, Eddie Pokming, et autres
Publié: (2025)
par: Sheung, Eddie Pokming, et autres
Publié: (2025)
Rethinking Video-Text Understanding: Retrieval from Counterfactually Augmented Data
par: Ma, Wufei, et autres
Publié: (2024)
par: Ma, Wufei, et autres
Publié: (2024)
From Pixel to Cancer: Cellular Automata in Computed Tomography
par: Lai, Yuxiang, et autres
Publié: (2024)
par: Lai, Yuxiang, et autres
Publié: (2024)
ImageNet3D: Towards General-Purpose Object-Level 3D Understanding
par: Ma, Wufei, et autres
Publié: (2024)
par: Ma, Wufei, et autres
Publié: (2024)
ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access
par: Yang, Timing, et autres
Publié: (2025)
par: Yang, Timing, et autres
Publié: (2025)
Dictionary-based Framework for Interpretable and Consistent Object Parsing
par: Zhang, Tiezheng, et autres
Publié: (2025)
par: Zhang, Tiezheng, et autres
Publié: (2025)
SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
par: Ma, Wufei, et autres
Publié: (2025)
par: Ma, Wufei, et autres
Publié: (2025)
4D-Animal: Freely Reconstructing Animatable 3D Animals from Videos
par: Zhong, Shanshan, et autres
Publié: (2025)
par: Zhong, Shanshan, et autres
Publié: (2025)
CamFreeDiff: Camera-free Image to Panorama Generation with Diffusion Model
par: Yuan, Xiaoding, et autres
Publié: (2024)
par: Yuan, Xiaoding, et autres
Publié: (2024)
XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models
par: Wang, Xingrui, et autres
Publié: (2025)
par: Wang, Xingrui, et autres
Publié: (2025)
FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching
par: Ren, Sucheng, et autres
Publié: (2024)
par: Ren, Sucheng, et autres
Publié: (2024)
PixelFlow: Pixel-Space Generative Models with Flow
par: Chen, Shoufa, et autres
Publié: (2025)
par: Chen, Shoufa, et autres
Publié: (2025)
Grouping First, Attending Smartly: Training-Free Acceleration for Diffusion Transformers
par: Ren, Sucheng, et autres
Publié: (2025)
par: Ren, Sucheng, et autres
Publié: (2025)
Generative Animations: A Multi-Model Pipeline for Prompt-Driven Motion Synthesis
par: Khurana, Mannat, et autres
Publié: (2026)
par: Khurana, Mannat, et autres
Publié: (2026)
Can These Views Be One Scene? Evaluating Multiview 3D Consistency when 3D Foundation Models Hallucinate
par: Paul, Soumava, et autres
Publié: (2026)
par: Paul, Soumava, et autres
Publié: (2026)
SCLIP: Rethinking Self-Attention for Dense Vision-Language Inference
par: Wang, Feng, et autres
Publié: (2023)
par: Wang, Feng, et autres
Publié: (2023)
Quality Sentinel: Estimating Label Quality and Errors in Medical Segmentation Datasets
par: Chen, Yixiong, et autres
Publié: (2024)
par: Chen, Yixiong, et autres
Publié: (2024)
Source-Free and Image-Only Unsupervised Domain Adaptation for Category Level Object Pose Estimation
par: Kaushik, Prakhar, et autres
Publié: (2024)
par: Kaushik, Prakhar, et autres
Publié: (2024)
EchoingPixels: Cross-Modal Adaptive Token Reduction for Efficient Audio-Visual LLMs
par: Gong, Chao, et autres
Publié: (2025)
par: Gong, Chao, et autres
Publié: (2025)
FlowTok: Flowing Seamlessly Across Text and Image Tokens
par: He, Ju, et autres
Publié: (2025)
par: He, Ju, et autres
Publié: (2025)
LychSim: A Controllable and Interactive Simulation Framework for Vision Research
par: Ma, Wufei, et autres
Publié: (2026)
par: Ma, Wufei, et autres
Publié: (2026)
Frequency-Aware Flow Matching for High-Quality Image Generation
par: Ren, Sucheng, et autres
Publié: (2026)
par: Ren, Sucheng, et autres
Publié: (2026)
Beyond Masks: The Case for Medical Image Parsing
par: Gupta, Siddharth, et autres
Publié: (2026)
par: Gupta, Siddharth, et autres
Publié: (2026)
RNN as Linear Transformer: A Closer Investigation into Representational Potentials of Visual Mamba Models
par: Yang, Timing, et autres
Publié: (2025)
par: Yang, Timing, et autres
Publié: (2025)
From Pixels to Words -- Towards Native One-Vision Models at Scale
par: Diao, Haiwen, et autres
Publié: (2026)
par: Diao, Haiwen, et autres
Publié: (2026)
CrossFlowDG: Bridging the Modality Gap with Cross-modal Flow Matching for Domain Generalization
par: Kritikos, Antonios, et autres
Publié: (2026)
par: Kritikos, Antonios, et autres
Publié: (2026)
Cross-Modal Prototype Alignment and Mixing for Training-Free Few-Shot Classification
par: Goswami, Dipam, et autres
Publié: (2026)
par: Goswami, Dipam, et autres
Publié: (2026)
A Bayesian Approach to OOD Robustness in Image Classification
par: Kaushik, Prakhar, et autres
Publié: (2024)
par: Kaushik, Prakhar, et autres
Publié: (2024)
Exploring Cross-Modal Flows for Few-Shot Learning
par: Jiang, Ziqi, et autres
Publié: (2025)
par: Jiang, Ziqi, et autres
Publié: (2025)
PixelFlowCast: Latent-Free Precipitation Nowcasting via Pixel Mean Flows
par: Zhu, Yufeng, et autres
Publié: (2026)
par: Zhu, Yufeng, et autres
Publié: (2026)
Cross-Modal Mapping: Mitigating the Modality Gap for Few-Shot Image Classification
par: Yang, Xi, et autres
Publié: (2024)
par: Yang, Xi, et autres
Publié: (2024)
Cross-Modal Knowledge Distillation for PET-Free Amyloid-Beta Detection from MRI
par: Chiumento, Francesco, et autres
Publié: (2026)
par: Chiumento, Francesco, et autres
Publié: (2026)
Fast-then-Fine: A Two-Stage Framework with Multi-Granular Representation for Cross-Modal Retrieval in Remote Sensing
par: Chen, Xi, et autres
Publié: (2026)
par: Chen, Xi, et autres
Publié: (2026)
Documents similaires
-
DIRECT-3D: Learning Direct Text-to-3D Generation on Massive Noisy 3D Data
par: Liu, Qihao, et autres
Publié: (2024) -
From Pixels to Objects: A Hierarchical Approach for Part and Object Segmentation Using Local and Global Aggregation
par: Xie, Yunfei, et autres
Publié: (2024) -
ReVision: Refining Video Diffusion with Explicit 3D Motion Modeling
par: Liu, Qihao, et autres
Publié: (2025) -
From Pixels and Words to Waves: A Unified Framework for Spectral Dictionary vLLMs
par: Kiruluta, Andrew, et autres
Publié: (2025) -
Computer Vision and Its Relationship to Cognitive Science: A perspective from Bayes Decision Theory
par: Yuille, Alan, et autres
Publié: (2026)