Genixer: Empowering Multimodal Large Language Models as a Powerful Data Generator
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhao, Henry Hengyuan, Zhou, Pan, Shou, Mike Zheng |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
InterFeedback: Unveiling Interactive Intelligence of Large Multimodal Models via Human Feedback
par: Zhao, Henry Hengyuan, et autres
Publié: (2025)
par: Zhao, Henry Hengyuan, et autres
Publié: (2025)
LOVA3: Learning to Visual Question Answering, Asking and Assessment
par: Zhao, Henry Hengyuan, et autres
Publié: (2024)
par: Zhao, Henry Hengyuan, et autres
Publié: (2024)
SCT: A Simple Baseline for Parameter-Efficient Fine-Tuning via Salient Channels
par: Zhao, Henry Hengyuan, et autres
Publié: (2023)
par: Zhao, Henry Hengyuan, et autres
Publié: (2023)
ControLRM: Fast and Controllable 3D Generation via Large Reconstruction Model
par: Xu, Hongbin, et autres
Publié: (2024)
par: Xu, Hongbin, et autres
Publié: (2024)
Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
par: Zeng, Ziyun, et autres
Publié: (2025)
par: Zeng, Ziyun, et autres
Publié: (2025)
Active-O3: Empowering Multimodal Large Language Models with Active Perception via GRPO
par: Zhu, Muzhi, et autres
Publié: (2025)
par: Zhu, Muzhi, et autres
Publié: (2025)
Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models
par: Wang, Jiaqi, et autres
Publié: (2025)
par: Wang, Jiaqi, et autres
Publié: (2025)
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
par: Sun, Jianwen, et autres
Publié: (2025)
par: Sun, Jianwen, et autres
Publié: (2025)
ShowUI-$π$: Flow-based Generative Models as GUI Dexterous Hands
par: Hu, Siyuan, et autres
Publié: (2025)
par: Hu, Siyuan, et autres
Publié: (2025)
LatticeWorld: A Multimodal Large Language Model-Empowered Framework for Interactive Complex World Generation
par: Duan, Yinglin, et autres
Publié: (2025)
par: Duan, Yinglin, et autres
Publié: (2025)
Can GPT tell us why these images are synthesized? Empowering Multimodal Large Language Models for Forensics
par: He, Yiran, et autres
Publié: (2025)
par: He, Yiran, et autres
Publié: (2025)
Factorized Learning for Temporally Grounded Video-Language Models
par: Zeng, Wenzheng, et autres
Publié: (2025)
par: Zeng, Wenzheng, et autres
Publié: (2025)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
par: Zheng, Shurong, et autres
Publié: (2026)
par: Zheng, Shurong, et autres
Publié: (2026)
The Paradigm Shift: A Comprehensive Survey on Large Vision Language Models for Multimodal Fake News Detection
par: Ai, Wei, et autres
Publié: (2026)
par: Ai, Wei, et autres
Publié: (2026)
On the Out-Of-Distribution Generalization of Multimodal Large Language Models
par: Zhang, Xingxuan, et autres
Publié: (2024)
par: Zhang, Xingxuan, et autres
Publié: (2024)
GeoDecoder: Empowering Multimodal Map Understanding
par: Qi, Feng, et autres
Publié: (2024)
par: Qi, Feng, et autres
Publié: (2024)
Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models
par: Sun, Haoyuan, et autres
Publié: (2025)
par: Sun, Haoyuan, et autres
Publié: (2025)
Skip \n: A Simple Method to Reduce Hallucination in Large Vision-Language Models
par: Han, Zongbo, et autres
Publié: (2024)
par: Han, Zongbo, et autres
Publié: (2024)
Robust Multimodal Large Language Models Against Modality Conflict
par: Zhang, Zongmeng, et autres
Publié: (2025)
par: Zhang, Zongmeng, et autres
Publié: (2025)
UniCode: Learning a Unified Codebook for Multimodal Large Language Models
par: Zheng, Sipeng, et autres
Publié: (2024)
par: Zheng, Sipeng, et autres
Publié: (2024)
Sparkle: Realizing Lively Instruction-Guided Video Background Replacement via Decoupled Guidance
par: Zeng, Ziyun, et autres
Publié: (2026)
par: Zeng, Ziyun, et autres
Publié: (2026)
Contextual Object Detection with Multimodal Large Language Models
par: Zang, Yuhang, et autres
Publié: (2023)
par: Zang, Yuhang, et autres
Publié: (2023)
Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models
par: Jiao, Qirui, et autres
Publié: (2024)
par: Jiao, Qirui, et autres
Publié: (2024)
LHRS-Bot: Empowering Remote Sensing with VGI-Enhanced Large Multimodal Language Model
par: Muhtar, Dilxat, et autres
Publié: (2024)
par: Muhtar, Dilxat, et autres
Publié: (2024)
AgriBench: A Hierarchical Agriculture Benchmark for Multimodal Large Language Models
par: Zhou, Yutong, et autres
Publié: (2024)
par: Zhou, Yutong, et autres
Publié: (2024)
MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models
par: Yao, Xincheng, et autres
Publié: (2026)
par: Yao, Xincheng, et autres
Publié: (2026)
H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos
par: Ci, Hai, et autres
Publié: (2025)
par: Ci, Hai, et autres
Publié: (2025)
Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
par: Li, Yinghui, et autres
Publié: (2026)
par: Li, Yinghui, et autres
Publié: (2026)
Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models
par: Fang, Chengyu, et autres
Publié: (2026)
par: Fang, Chengyu, et autres
Publié: (2026)
MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly Detection
par: Jiang, Xi, et autres
Publié: (2024)
par: Jiang, Xi, et autres
Publié: (2024)
Efficient Multimodal Large Language Models: A Survey
par: Jin, Yizhang, et autres
Publié: (2024)
par: Jin, Yizhang, et autres
Publié: (2024)
Model Composition for Multimodal Large Language Models
par: Chen, Chi, et autres
Publié: (2024)
par: Chen, Chi, et autres
Publié: (2024)
DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding
par: Feng, Hao, et autres
Publié: (2023)
par: Feng, Hao, et autres
Publié: (2023)
GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents
par: Ouyang, Mingyu, et autres
Publié: (2026)
par: Ouyang, Mingyu, et autres
Publié: (2026)
White-box Multimodal Jailbreaks Against Large Vision-Language Models
par: Wang, Ruofan, et autres
Publié: (2024)
par: Wang, Ruofan, et autres
Publié: (2024)
Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models
par: Ye, Zhipeng, et autres
Publié: (2026)
par: Ye, Zhipeng, et autres
Publié: (2026)
Image is All You Need to Empower Large-scale Diffusion Models for In-Domain Generation
par: Cao, Pu, et autres
Publié: (2023)
par: Cao, Pu, et autres
Publié: (2023)
ProcessPainter: Learn Painting Process from Sequence Data
par: Song, Yiren, et autres
Publié: (2024)
par: Song, Yiren, et autres
Publié: (2024)
Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs
par: Yu, Mingyu, et autres
Publié: (2026)
par: Yu, Mingyu, et autres
Publié: (2026)
VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning
par: Liu, Ye, et autres
Publié: (2025)
par: Liu, Ye, et autres
Publié: (2025)
Documents similaires
-
InterFeedback: Unveiling Interactive Intelligence of Large Multimodal Models via Human Feedback
par: Zhao, Henry Hengyuan, et autres
Publié: (2025) -
LOVA3: Learning to Visual Question Answering, Asking and Assessment
par: Zhao, Henry Hengyuan, et autres
Publié: (2024) -
SCT: A Simple Baseline for Parameter-Efficient Fine-Tuning via Salient Channels
par: Zhao, Henry Hengyuan, et autres
Publié: (2023) -
ControLRM: Fast and Controllable 3D Generation via Large Reconstruction Model
par: Xu, Hongbin, et autres
Publié: (2024) -
Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing
par: Zeng, Ziyun, et autres
Publié: (2025)