MMEvol: Empowering Multimodal Large Language Models with Evol-Instruct
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Luo, Run, Zhang, Haonan, Chen, Longze, Lin, Ting-En, Liu, Xiong, Wu, Yuchuan, Yang, Min, Wang, Minzheng, Zeng, Pengpeng, Gao, Lianli, Shen, Heng Tao, Li, Yunshui, Xia, Xiaobo, Huang, Fei, Song, Jingkuan, Li, Yongbin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction
par: Zhang, Haonan, et autres
Publié: (2025)
par: Zhang, Haonan, et autres
Publié: (2025)
OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-Time Self-Aware Emotional Speech Synthesis
par: Luo, Run, et autres
Publié: (2025)
par: Luo, Run, et autres
Publié: (2025)
Hierarchical Context Pruning: Optimizing Real-World Code Completion with Repository-Level Pretrained Code LLMs
par: Zhang, Lei, et autres
Publié: (2024)
par: Zhang, Lei, et autres
Publié: (2024)
CFReID: Continual Few-shot Person Re-Identification
par: Ni, Hao, et autres
Publié: (2025)
par: Ni, Hao, et autres
Publié: (2025)
The Imperative of Conversation Analysis in the Era of LLMs: A Survey of Tasks, Techniques, and Trends
par: Zhang, Xinghua, et autres
Publié: (2024)
par: Zhang, Xinghua, et autres
Publié: (2024)
Leave No Document Behind: Benchmarking Long-Context LLMs with Extended Multi-Doc QA
par: Wang, Minzheng, et autres
Publié: (2024)
par: Wang, Minzheng, et autres
Publié: (2024)
Long Context is Not Long at All: A Prospector of Long-Dependency Data for Large Language Models
par: Chen, Longze, et autres
Publié: (2024)
par: Chen, Longze, et autres
Publié: (2024)
IP-MOT: Instance Prompt Learning for Cross-Domain Multi-Object Tracking
par: Luo, Run, et autres
Publié: (2024)
par: Luo, Run, et autres
Publié: (2024)
WizardCoder: Empowering Code Large Language Models with Evol-Instruct
par: Luo, Ziyang, et autres
Publié: (2023)
par: Luo, Ziyang, et autres
Publié: (2023)
Text-Video Retrieval with Global-Local Semantic Consistent Learning
par: Zhang, Haonan, et autres
Publié: (2024)
par: Zhang, Haonan, et autres
Publié: (2024)
SeMv-3D: Towards Concurrency of Semantic and Multi-view Consistency in General Text-to-3D Generation
par: Cai, Xiao, et autres
Publié: (2024)
par: Cai, Xiao, et autres
Publié: (2024)
TIMI: Training-Free Image-to-3D Multi-Instance Generation with Spatial Fidelity
par: Cai, Xiao, et autres
Publié: (2026)
par: Cai, Xiao, et autres
Publié: (2026)
Skip Tuning: Pre-trained Vision-Language Models are Effective and Efficient Adapters Themselves
par: Wu, Shihan, et autres
Publié: (2024)
par: Wu, Shihan, et autres
Publié: (2024)
DEEM: Diffusion Models Serve as the Eyes of Large Language Models for Image Perception
par: Luo, Run, et autres
Publié: (2024)
par: Luo, Run, et autres
Publié: (2024)
ProS: Prompting-to-simulate Generalized knowledge for Universal Cross-Domain Retrieval
par: Fang, Kaipeng, et autres
Publié: (2023)
par: Fang, Kaipeng, et autres
Publié: (2023)
Towards Generalized and Training-Free Text-Guided Semantic Manipulation
par: Hong, Yu, et autres
Publié: (2025)
par: Hong, Yu, et autres
Publié: (2025)
WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct
par: Luo, Haipeng, et autres
Publié: (2023)
par: Luo, Haipeng, et autres
Publié: (2023)
Reversible Inversion for Training-Free Exemplar-guided Image Editing
par: Li, Yuke, et autres
Publié: (2025)
par: Li, Yuke, et autres
Publié: (2025)
Sim-and-Human Co-training for Data-Efficient and Generalizable Robotic Manipulation
par: Fang, Kaipeng, et autres
Publié: (2026)
par: Fang, Kaipeng, et autres
Publié: (2026)
Ruler: A Model-Agnostic Method to Control Generated Length for Large Language Models
par: Li, Jiaming, et autres
Publié: (2024)
par: Li, Jiaming, et autres
Publié: (2024)
Marathon: A Race Through the Realm of Long Context with Large Language Models
par: Zhang, Lei, et autres
Publié: (2023)
par: Zhang, Lei, et autres
Publié: (2023)
SafePTR: Token-Level Jailbreak Defense in Multimodal LLMs via Prune-then-Restore Mechanism
par: Chen, Beitao, et autres
Publié: (2025)
par: Chen, Beitao, et autres
Publié: (2025)
A Survey on Efficient Vision-Language-Action Models
par: Yu, Zhaoshu, et autres
Publié: (2025)
par: Yu, Zhaoshu, et autres
Publié: (2025)
From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion
par: Chen, Cheng, et autres
Publié: (2026)
par: Chen, Cheng, et autres
Publié: (2026)
GT23D-Bench: A Comprehensive General Text-to-3D Generation Benchmark
par: Cai, Xiao, et autres
Publié: (2024)
par: Cai, Xiao, et autres
Publié: (2024)
GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents
par: Luo, Run, et autres
Publié: (2025)
par: Luo, Run, et autres
Publié: (2025)
Prototype-based Aleatoric Uncertainty Quantification for Cross-modal Retrieval
par: Li, Hao, et autres
Publié: (2023)
par: Li, Hao, et autres
Publié: (2023)
VCM: Vision Concept Modeling Based on Implicit Contrastive Learning with Vision-Language Instruction Fine-Tuning
par: Luo, Run, et autres
Publié: (2025)
par: Luo, Run, et autres
Publié: (2025)
Structure-aware Prompt Adaptation from Seen to Unseen for Open-Vocabulary Compositional Zero-Shot Learning
par: Duan, Yihang, et autres
Publié: (2026)
par: Duan, Yihang, et autres
Publié: (2026)
Reverse Preference Optimization for Complex Instruction Following
par: Huang, Xiang, et autres
Publié: (2025)
par: Huang, Xiang, et autres
Publié: (2025)
Improving Factual Consistency of News Summarization by Contrastive Preference Optimization
par: Feng, Huawen, et autres
Publié: (2023)
par: Feng, Huawen, et autres
Publié: (2023)
Debiased Orthogonal Boundary-Driven Efficient Noise Mitigation
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
EIFBENCH: Extremely Complex Instruction Following Benchmark for Large Language Models
par: Zou, Tao, et autres
Publié: (2025)
par: Zou, Tao, et autres
Publié: (2025)
Reliable Few-shot Learning under Dual Noises
par: Zhang, Ji, et autres
Publié: (2025)
par: Zhang, Ji, et autres
Publié: (2025)
DePT: Decoupled Prompt Tuning
par: Zhang, Ji, et autres
Publié: (2023)
par: Zhang, Ji, et autres
Publié: (2023)
AICL: Action In-Context Learning for Video Diffusion Model
par: Liu, Jianzhi, et autres
Publié: (2024)
par: Liu, Jianzhi, et autres
Publié: (2024)
Alleviating Hallucinations in Large Vision-Language Models through Hallucination-Induced Optimization
par: Lyu, Xinyu, et autres
Publié: (2024)
par: Lyu, Xinyu, et autres
Publié: (2024)
Beyond the Majority: Long-tail Imitation Learning for Robotic Manipulation
par: Zhu, Junhong, et autres
Publié: (2026)
par: Zhu, Junhong, et autres
Publié: (2026)
Attention Hijackers: Detect and Disentangle Attention Hijacking in LVLMs for Hallucination Mitigation
par: Chen, Beitao, et autres
Publié: (2025)
par: Chen, Beitao, et autres
Publié: (2025)
Benchmarking Few-shot Transferability of Pre-trained Models with Improved Evaluation Protocols
par: Luo, Xu, et autres
Publié: (2026)
par: Luo, Xu, et autres
Publié: (2026)
Documents similaires
-
OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction
par: Zhang, Haonan, et autres
Publié: (2025) -
OpenOmni: Advancing Open-Source Omnimodal Large Language Models with Progressive Multimodal Alignment and Real-Time Self-Aware Emotional Speech Synthesis
par: Luo, Run, et autres
Publié: (2025) -
Hierarchical Context Pruning: Optimizing Real-World Code Completion with Repository-Level Pretrained Code LLMs
par: Zhang, Lei, et autres
Publié: (2024) -
CFReID: Continual Few-shot Person Re-Identification
par: Ni, Hao, et autres
Publié: (2025) -
The Imperative of Conversation Analysis in the Era of LLMs: A Survey of Tasks, Techniques, and Trends
par: Zhang, Xinghua, et autres
Publié: (2024)