HermesFlow: Seamlessly Closing the Gap in Multimodal Understanding and Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Ling, Zhang, Xinchen, Tian, Ye, Shang, Chenming, Xu, Minghao, Zhang, Wentao, Cui, Bin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Diffusion-Sharpening: Fine-tuning Diffusion Models with Denoising Trajectory Sharpening
por: Tian, Ye, et al.
Publicado: (2025)
por: Tian, Ye, et al.
Publicado: (2025)
Understanding Multimodal Deep Neural Networks: A Concept Selection View
por: Shang, Chenming, et al.
Publicado: (2024)
por: Shang, Chenming, et al.
Publicado: (2024)
MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods
por: Lin, Honglin, et al.
Publicado: (2026)
por: Lin, Honglin, et al.
Publicado: (2026)
MMaDA: Multimodal Large Diffusion Language Models
por: Yang, Ling, et al.
Publicado: (2025)
por: Yang, Ling, et al.
Publicado: (2025)
Consistency Flow Matching: Defining Straight Flows with Velocity Consistency
por: Yang, Ling, et al.
Publicado: (2024)
por: Yang, Ling, et al.
Publicado: (2024)
X2I: Seamless Integration of Multimodal Understanding into Diffusion Transformer via Attention Distillation
por: Ma, Jian, et al.
Publicado: (2025)
por: Ma, Jian, et al.
Publicado: (2025)
IterComp: Iterative Composition-Aware Feedback Learning from Model Gallery for Text-to-Image Generation
por: Zhang, Xinchen, et al.
Publicado: (2024)
por: Zhang, Xinchen, et al.
Publicado: (2024)
RecipeGen: A Step-Aligned Multimodal Benchmark for Real-World Recipe Generation
por: Zhang, Ruoxuan, et al.
Publicado: (2025)
por: Zhang, Ruoxuan, et al.
Publicado: (2025)
Harmonizing Visual Representations for Unified Multimodal Understanding and Generation
por: Wu, Size, et al.
Publicado: (2025)
por: Wu, Size, et al.
Publicado: (2025)
Generative Universal Verifier as Multimodal Meta-Reasoner
por: Zhang, Xinchen, et al.
Publicado: (2025)
por: Zhang, Xinchen, et al.
Publicado: (2025)
TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation
por: Qu, Liao, et al.
Publicado: (2024)
por: Qu, Liao, et al.
Publicado: (2024)
Breaking the Encoder Barrier for Seamless Video-Language Understanding
por: Li, Handong, et al.
Publicado: (2025)
por: Li, Handong, et al.
Publicado: (2025)
How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites
por: Chen, Zhe, et al.
Publicado: (2024)
por: Chen, Zhe, et al.
Publicado: (2024)
Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities
por: Zhao, Shanshan, et al.
Publicado: (2025)
por: Zhao, Shanshan, et al.
Publicado: (2025)
FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding
por: Liu, Zheng, et al.
Publicado: (2025)
por: Liu, Zheng, et al.
Publicado: (2025)
Retrieval-Augmented Generation for AI-Generated Content: A Survey
por: Zhao, Penghao, et al.
Publicado: (2024)
por: Zhao, Penghao, et al.
Publicado: (2024)
Mobius: Text to Seamless Looping Video Generation via Latent Shift
por: Bi, Xiuli, et al.
Publicado: (2025)
por: Bi, Xiuli, et al.
Publicado: (2025)
DocKylin: A Large Multimodal Model for Visual Document Understanding with Efficient Visual Slimming
por: Zhang, Jiaxin, et al.
Publicado: (2024)
por: Zhang, Jiaxin, et al.
Publicado: (2024)
Closing the Safety Gap: Surgical Concept Erasure in Visual Autoregressive Models
por: Zhong, Xinhao, et al.
Publicado: (2025)
por: Zhong, Xinhao, et al.
Publicado: (2025)
FlowTok: Flowing Seamlessly Across Text and Image Tokens
por: He, Ju, et al.
Publicado: (2025)
por: He, Ju, et al.
Publicado: (2025)
Generative Giants, Retrieval Weaklings: Why do Multimodal Large Language Models Fail at Multimodal Retrieval?
por: Feng, Hengyi, et al.
Publicado: (2025)
por: Feng, Hengyi, et al.
Publicado: (2025)
Universal Medical Image Representation Learning with Compositional Decoders
por: Wang, Kaini, et al.
Publicado: (2024)
por: Wang, Kaini, et al.
Publicado: (2024)
NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation
por: Zhang, Huichao, et al.
Publicado: (2026)
por: Zhang, Huichao, et al.
Publicado: (2026)
AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse Guidance
por: Wang, Zhao, et al.
Publicado: (2025)
por: Wang, Zhao, et al.
Publicado: (2025)
Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models
por: Tong, Yujun, et al.
Publicado: (2026)
por: Tong, Yujun, et al.
Publicado: (2026)
VQGraph: Rethinking Graph Representation Space for Bridging GNNs and MLPs
por: Yang, Ling, et al.
Publicado: (2023)
por: Yang, Ling, et al.
Publicado: (2023)
RealCompo: Balancing Realism and Compositionality Improves Text-to-Image Diffusion Models
por: Zhang, Xinchen, et al.
Publicado: (2024)
por: Zhang, Xinchen, et al.
Publicado: (2024)
Mastering Text-to-Image Diffusion: Recaptioning, Planning, and Generating with Multimodal LLMs
por: Yang, Ling, et al.
Publicado: (2024)
por: Yang, Ling, et al.
Publicado: (2024)
Do Joint Audio-Video Generation Models Understand Physics?
por: Cui, Zijun, et al.
Publicado: (2026)
por: Cui, Zijun, et al.
Publicado: (2026)
UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation
por: Tian, Rui, et al.
Publicado: (2025)
por: Tian, Rui, et al.
Publicado: (2025)
VideoTetris: Towards Compositional Text-to-Video Generation
por: Tian, Ye, et al.
Publicado: (2024)
por: Tian, Ye, et al.
Publicado: (2024)
InternVL-U: Democratizing Unified Multimodal Models for Understanding, Reasoning, Generation and Editing
por: Tian, Changyao, et al.
Publicado: (2026)
por: Tian, Changyao, et al.
Publicado: (2026)
FlowVQTalker: High-Quality Emotional Talking Face Generation through Normalizing Flow and Quantization
por: Tan, Shuai, et al.
Publicado: (2024)
por: Tan, Shuai, et al.
Publicado: (2024)
DynamicScaler: Seamless and Scalable Video Generation for Panoramic Scenes
por: Liu, Jinxiu, et al.
Publicado: (2024)
por: Liu, Jinxiu, et al.
Publicado: (2024)
FlowScene: Style-Consistent Indoor Scene Generation with Multimodal Graph Rectified Flow
por: Yang, Zhifei, et al.
Publicado: (2026)
por: Yang, Zhifei, et al.
Publicado: (2026)
GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous Driving
por: Xing, Zebin, et al.
Publicado: (2025)
por: Xing, Zebin, et al.
Publicado: (2025)
MME-Unify: A Comprehensive Benchmark for Unified Multimodal Understanding and Generation Models
por: Xie, Wulin, et al.
Publicado: (2025)
por: Xie, Wulin, et al.
Publicado: (2025)
ESCA: Enabling Seamless Codec Avatar Execution through Algorithm and Hardware Co-Optimization for Virtual Reality
por: Zhu, Mingzhi, et al.
Publicado: (2025)
por: Zhu, Mingzhi, et al.
Publicado: (2025)
SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing
por: Zhang, Tong, et al.
Publicado: (2026)
por: Zhang, Tong, et al.
Publicado: (2026)
VQRAE: Representation Quantization Autoencoders for Multimodal Understanding, Generation and Reconstruction
por: Du, Sinan, et al.
Publicado: (2025)
por: Du, Sinan, et al.
Publicado: (2025)
Ejemplares similares
-
Diffusion-Sharpening: Fine-tuning Diffusion Models with Denoising Trajectory Sharpening
por: Tian, Ye, et al.
Publicado: (2025) -
Understanding Multimodal Deep Neural Networks: A Concept Selection View
por: Shang, Chenming, et al.
Publicado: (2024) -
MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods
por: Lin, Honglin, et al.
Publicado: (2026) -
MMaDA: Multimodal Large Diffusion Language Models
por: Yang, Ling, et al.
Publicado: (2025) -
Consistency Flow Matching: Defining Straight Flows with Velocity Consistency
por: Yang, Ling, et al.
Publicado: (2024)