List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yan, An, Yang, Zhengyuan, Wu, Junda, Zhu, Wanrong, Yang, Jianwei, Li, Linjie, Lin, Kevin, Wang, Jianfeng, McAuley, Julian, Gao, Jianfeng, Wang, Lijuan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
par: Jain, Jitesh, et autres
Publié: (2024)
par: Jain, Jitesh, et autres
Publié: (2024)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2023)
par: Yu, Weihao, et autres
Publié: (2023)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
par: Liu, Qin, et autres
Publié: (2024)
par: Liu, Qin, et autres
Publié: (2024)
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
par: Yang, Zhengyuan, et autres
Publié: (2023)
par: Yang, Zhengyuan, et autres
Publié: (2023)
Bring Metric Functions into Diffusion Models
par: An, Jie, et autres
Publié: (2024)
par: An, Jie, et autres
Publié: (2024)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2024)
par: Yu, Weihao, et autres
Publié: (2024)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
par: Lin, Kevin Qinghong, et autres
Publié: (2024)
Importance Sampling for Multi-Negative Multimodal Direct Preference Optimization
par: Li, Xintong, et autres
Publié: (2025)
par: Li, Xintong, et autres
Publié: (2025)
InstructGraph: Boosting Large Language Models via Graph-centric Instruction Tuning and Preference Alignment
par: Wang, Jianing, et autres
Publié: (2024)
par: Wang, Jianing, et autres
Publié: (2024)
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
par: Wang, Alex Jinpeng, et autres
Publié: (2024)
par: Wang, Alex Jinpeng, et autres
Publié: (2024)
FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching
par: Yi, Junchao, et autres
Publié: (2026)
par: Yi, Junchao, et autres
Publié: (2026)
PDB-Eval: An Evaluation of Large Multimodal Models for Description and Explanation of Personalized Driving Behavior
par: Wu, Junda, et autres
Publié: (2025)
par: Wu, Junda, et autres
Publié: (2025)
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
par: Liu, Fuxiao, et autres
Publié: (2023)
par: Liu, Fuxiao, et autres
Publié: (2023)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
par: Wang, Alex Jinpeng, et autres
Publié: (2025)
par: Wang, Alex Jinpeng, et autres
Publié: (2025)
SITE: towards Spatial Intelligence Thorough Evaluation
par: Wang, Wenqi, et autres
Publié: (2025)
par: Wang, Wenqi, et autres
Publié: (2025)
MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
par: He, Xuehai, et autres
Publié: (2024)
par: He, Xuehai, et autres
Publié: (2024)
Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
par: Zhai, Yuanhao, et autres
Publié: (2024)
par: Zhai, Yuanhao, et autres
Publié: (2024)
Matryoshka Multimodal Models
par: Cai, Mu, et autres
Publié: (2024)
par: Cai, Mu, et autres
Publié: (2024)
GenXD: Generating Any 3D and 4D Scenes
par: Zhao, Yuyang, et autres
Publié: (2024)
par: Zhao, Yuyang, et autres
Publié: (2024)
Beyond Chain-of-Thought: A Survey of Chain-of-X Paradigms for LLMs
par: Xia, Yu, et autres
Publié: (2024)
par: Xia, Yu, et autres
Publié: (2024)
EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing
par: Zheng, Kaizhi, et autres
Publié: (2024)
par: Zheng, Kaizhi, et autres
Publié: (2024)
Evaluating Memory in LLM Agents via Incremental Multi-Turn Interactions
par: Hu, Yuanzhe, et autres
Publié: (2025)
par: Hu, Yuanzhe, et autres
Publié: (2025)
Entity6K: A Large Open-Domain Evaluation Dataset for Real-World Entity Recognition
par: Qiu, Jielin, et autres
Publié: (2024)
par: Qiu, Jielin, et autres
Publié: (2024)
SceneAlign: Aligning Multimodal Reasoning to Scene Graphs in Complex Visual Scenes
par: Wang, Chuhan, et autres
Publié: (2026)
par: Wang, Chuhan, et autres
Publié: (2026)
Weakly-supervised VLM-guided Partial Contrastive Learning for Visual Language Navigation
par: Wang, Ruoyu, et autres
Publié: (2025)
par: Wang, Ruoyu, et autres
Publié: (2025)
Multi-Agent Collaborative Filtering: Orchestrating Users and Items for Agentic Recommendations
par: Xia, Yu, et autres
Publié: (2025)
par: Xia, Yu, et autres
Publié: (2025)
Imagery as Inquiry: Exploring A Multimodal Dataset for Conversational Recommendation
par: Yoon, Se-eun, et autres
Publié: (2024)
par: Yoon, Se-eun, et autres
Publié: (2024)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
par: Lin, Yan-Bo, et autres
Publié: (2025)
par: Lin, Yan-Bo, et autres
Publié: (2025)
Self-Updatable Large Language Models by Integrating Context into Model Parameters
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
par: Ni, Minheng, et autres
Publié: (2025)
par: Ni, Minheng, et autres
Publié: (2025)
IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
par: Zhai, Yuanhao, et autres
Publié: (2024)
par: Zhai, Yuanhao, et autres
Publié: (2024)
LVCHAT: Facilitating Long Video Comprehension
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
CoMMIT: Coordinated Multimodal Instruction Tuning
par: Li, Xintong, et autres
Publié: (2024)
par: Li, Xintong, et autres
Publié: (2024)
Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark
par: Hao, Yunzhuo, et autres
Publié: (2025)
par: Hao, Yunzhuo, et autres
Publié: (2025)
A Fashion Item Recommendation Model in Hyperbolic Space
par: Shimizu, Ryotaro, et autres
Publié: (2024)
par: Shimizu, Ryotaro, et autres
Publié: (2024)
Interfacing Foundation Models' Embeddings
par: Zou, Xueyan, et autres
Publié: (2023)
par: Zou, Xueyan, et autres
Publié: (2023)
Pix2Gif: Motion-Guided Diffusion for GIF Generation
par: Kandala, Hitesh, et autres
Publié: (2024)
par: Kandala, Hitesh, et autres
Publié: (2024)
Unlocking Decoding-time Controllability: Gradient-Free Multi-Objective Alignment with Contrastive Prompts
par: Fu, Tingchen, et autres
Publié: (2024)
par: Fu, Tingchen, et autres
Publié: (2024)
Cognitive Bias in Decision-Making with LLMs
par: Echterhoff, Jessica, et autres
Publié: (2024)
par: Echterhoff, Jessica, et autres
Publié: (2024)
Extending Input Contexts of Language Models through Training on Segmented Sequences
par: Karypis, Petros, et autres
Publié: (2023)
par: Karypis, Petros, et autres
Publié: (2023)
Documents similaires
-
Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
par: Jain, Jitesh, et autres
Publié: (2024) -
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
par: Yu, Weihao, et autres
Publié: (2023) -
LiVOS: Light Video Object Segmentation with Gated Linear Matching
par: Liu, Qin, et autres
Publié: (2024) -
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
par: Yang, Zhengyuan, et autres
Publié: (2023) -
Bring Metric Functions into Diffusion Models
par: An, Jie, et autres
Publié: (2024)