Guardado en:
| Autores principales: | He, Xuehai, Feng, Weixi, Zheng, Kaizhi, Lu, Yujie, Zhu, Wanrong, Li, Jiachen, Fan, Yue, Wang, Jianfeng, Li, Linjie, Yang, Zhengyuan, Lin, Kevin, Wang, William Yang, Wang, Lijuan, Wang, Xin Eric |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2406.08407 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing
por: Zheng, Kaizhi, et al.
Publicado: (2024)
por: Zheng, Kaizhi, et al.
Publicado: (2024)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
por: Liu, Qin, et al.
Publicado: (2024)
por: Liu, Qin, et al.
Publicado: (2024)
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
por: Yan, An, et al.
Publicado: (2024)
por: Yan, An, et al.
Publicado: (2024)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
por: Yu, Weihao, et al.
Publicado: (2023)
por: Yu, Weihao, et al.
Publicado: (2023)
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
por: Liu, Fuxiao, et al.
Publicado: (2023)
por: Liu, Fuxiao, et al.
Publicado: (2023)
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
por: Yang, Zhengyuan, et al.
Publicado: (2023)
por: Yang, Zhengyuan, et al.
Publicado: (2023)
Bring Metric Functions into Diffusion Models
por: An, Jie, et al.
Publicado: (2024)
por: An, Jie, et al.
Publicado: (2024)
Entity6K: A Large Open-Domain Evaluation Dataset for Real-World Entity Recognition
por: Qiu, Jielin, et al.
Publicado: (2024)
por: Qiu, Jielin, et al.
Publicado: (2024)
Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
por: Zhai, Yuanhao, et al.
Publicado: (2024)
por: Zhai, Yuanhao, et al.
Publicado: (2024)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
por: Hao, Yunzhuo, et al.
Publicado: (2025)
por: Hao, Yunzhuo, et al.
Publicado: (2025)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
por: Wang, Alex Jinpeng, et al.
Publicado: (2025)
por: Wang, Alex Jinpeng, et al.
Publicado: (2025)
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
por: Wang, Alex Jinpeng, et al.
Publicado: (2024)
por: Wang, Alex Jinpeng, et al.
Publicado: (2024)
IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
por: Zhai, Yuanhao, et al.
Publicado: (2024)
por: Zhai, Yuanhao, et al.
Publicado: (2024)
MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens
por: Zheng, Kaizhi, et al.
Publicado: (2023)
por: Zheng, Kaizhi, et al.
Publicado: (2023)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
por: Yu, Weihao, et al.
Publicado: (2024)
por: Yu, Weihao, et al.
Publicado: (2024)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
por: Liao, Jiaqi, et al.
Publicado: (2025)
por: Liao, Jiaqi, et al.
Publicado: (2025)
VideoGUI: A Benchmark for GUI Automation from Instructional Videos
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
por: Cho, Jaemin, et al.
Publicado: (2023)
por: Cho, Jaemin, et al.
Publicado: (2023)
Computer-Use Agents as Judges for Generative User Interface
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
GenXD: Generating Any 3D and 4D Scenes
por: Zhao, Yuyang, et al.
Publicado: (2024)
por: Zhao, Yuyang, et al.
Publicado: (2024)
SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation
por: Hong, Yining, et al.
Publicado: (2024)
por: Hong, Yining, et al.
Publicado: (2024)
Self-Evolving 3D Scene Generation from a Single Image
por: Zheng, Kaizhi, et al.
Publicado: (2025)
por: Zheng, Kaizhi, et al.
Publicado: (2025)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
por: Lin, Yan-Bo, et al.
Publicado: (2025)
por: Lin, Yan-Bo, et al.
Publicado: (2025)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
por: Ni, Minheng, et al.
Publicado: (2025)
por: Ni, Minheng, et al.
Publicado: (2025)
VAGEN: Reinforcing World Model Reasoning for Multi-Turn VLM Agents
por: Wang, Kangrui, et al.
Publicado: (2025)
por: Wang, Kangrui, et al.
Publicado: (2025)
Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents
por: Zheng, Kaizhi, et al.
Publicado: (2022)
por: Zheng, Kaizhi, et al.
Publicado: (2022)
Exploring a Unified Vision-Centric Contrastive Alternatives on Multi-Modal Web Documents
por: Lin, Yiqi, et al.
Publicado: (2025)
por: Lin, Yiqi, et al.
Publicado: (2025)
TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation
por: Feng, Weixi, et al.
Publicado: (2024)
por: Feng, Weixi, et al.
Publicado: (2024)
MorphoSim: An Interactive, Controllable, and Editable Language-guided 4D World Simulator
por: He, Xuehai, et al.
Publicado: (2025)
por: He, Xuehai, et al.
Publicado: (2025)
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
por: Wang, Xiyao, et al.
Publicado: (2025)
por: Wang, Xiyao, et al.
Publicado: (2025)
Reward Guided Latent Consistency Distillation
por: Li, Jiachen, et al.
Publicado: (2024)
por: Li, Jiachen, et al.
Publicado: (2024)
DisCo: Disentangled Control for Realistic Human Dance Generation
por: Wang, Tan, et al.
Publicado: (2023)
por: Wang, Tan, et al.
Publicado: (2023)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments
por: Chen, Jiali, et al.
Publicado: (2025)
por: Chen, Jiali, et al.
Publicado: (2025)
Glance: Accelerating Diffusion Models with 1 Sample
por: Dong, Zhuobai, et al.
Publicado: (2025)
por: Dong, Zhuobai, et al.
Publicado: (2025)
V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models
por: Zheng, Xiangxi, et al.
Publicado: (2025)
por: Zheng, Xiangxi, et al.
Publicado: (2025)
Interfacing Foundation Models' Embeddings
por: Zou, Xueyan, et al.
Publicado: (2023)
por: Zou, Xueyan, et al.
Publicado: (2023)
Measurement of LLM's Philosophies of Human Nature
por: Ni, Minheng, et al.
Publicado: (2025)
por: Ni, Minheng, et al.
Publicado: (2025)
TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering
por: Mao, Dongxing, et al.
Publicado: (2026)
por: Mao, Dongxing, et al.
Publicado: (2026)
Ejemplares similares
-
EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing
por: Zheng, Kaizhi, et al.
Publicado: (2024) -
LiVOS: Light Video Object Segmentation with Gated Linear Matching
por: Liu, Qin, et al.
Publicado: (2024) -
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
por: Yan, An, et al.
Publicado: (2024) -
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
por: Yu, Weihao, et al.
Publicado: (2023) -
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
por: Liu, Fuxiao, et al.
Publicado: (2023)