UniAPO: Unified Multimodal Automated Prompt Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhu, Qipeng, Chen, Yanzhe, Zhong, Huasong, Li, Yan, Chen, Jie, Zhang, Zhixin, Zhang, Junping, Yang, Zhenheng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation
par: Chen, Yanzhe, et autres
Publié: (2025)
par: Chen, Yanzhe, et autres
Publié: (2025)
UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths
par: Mao, Weijia, et autres
Publié: (2025)
par: Mao, Weijia, et autres
Publié: (2025)
UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
par: Mao, Weijia, et autres
Publié: (2025)
par: Mao, Weijia, et autres
Publié: (2025)
ProAPO: Progressively Automatic Prompt Optimization for Visual Classification
par: Qu, Xiangyan, et autres
Publié: (2025)
par: Qu, Xiangyan, et autres
Publié: (2025)
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
par: Zhao, Yaqi, et autres
Publié: (2026)
par: Zhao, Yaqi, et autres
Publié: (2026)
Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers
par: Zhu, Jingyuan, et autres
Publié: (2026)
par: Zhu, Jingyuan, et autres
Publié: (2026)
Show-o2: Improved Native Unified Multimodal Models
par: Xie, Jinheng, et autres
Publié: (2025)
par: Xie, Jinheng, et autres
Publié: (2025)
UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model
par: Zhuang, Shaobin, et autres
Publié: (2026)
par: Zhuang, Shaobin, et autres
Publié: (2026)
UniVS: Unified and Universal Video Segmentation with Prompts as Queries
par: Li, Minghan, et autres
Publié: (2024)
par: Li, Minghan, et autres
Publié: (2024)
Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers
par: Yao, Yuxuan, et autres
Publié: (2026)
par: Yao, Yuxuan, et autres
Publié: (2026)
UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation
par: Li, Teng, et autres
Publié: (2025)
par: Li, Teng, et autres
Publié: (2025)
UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding
par: Jiao, Yang, et autres
Publié: (2025)
par: Jiao, Yang, et autres
Publié: (2025)
UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark
par: Li, Yanlin, et autres
Publié: (2026)
par: Li, Yanlin, et autres
Publié: (2026)
UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation
par: Liu, Jie, et autres
Publié: (2026)
par: Liu, Jie, et autres
Publié: (2026)
Cream of the Crop: Harvesting Rich, Scalable and Transferable Multi-Modal Data for Instruction Fine-Tuning
par: Lyu, Mengyao, et autres
Publié: (2025)
par: Lyu, Mengyao, et autres
Publié: (2025)
UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation
par: Wu, Size, et autres
Publié: (2025)
par: Wu, Size, et autres
Publié: (2025)
UniVBench: Towards Unified Evaluation for Video Foundation Models
par: Wei, Jianhui, et autres
Publié: (2026)
par: Wei, Jianhui, et autres
Publié: (2026)
UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation
par: Li, Yi, et autres
Publié: (2025)
par: Li, Yi, et autres
Publié: (2025)
UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors
par: Chen, Houyuan, et autres
Publié: (2026)
par: Chen, Houyuan, et autres
Publié: (2026)
APO: Enhancing Reasoning Ability of MLLMs via Asymmetric Policy Optimization
par: Hong, Minjie, et autres
Publié: (2025)
par: Hong, Minjie, et autres
Publié: (2025)
MMTL-UniAD: A Unified Framework for Multimodal and Multi-Task Learning in Assistive Driving Perception
par: Liu, Wenzhuo, et autres
Publié: (2025)
par: Liu, Wenzhuo, et autres
Publié: (2025)
ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction
par: Tan, Jiangtong, et autres
Publié: (2025)
par: Tan, Jiangtong, et autres
Publié: (2025)
UniABG: Unified Adversarial View Bridging and Graph Correspondence for Unsupervised Cross-View Geo-Localization
par: Chen, Cuiqun, et autres
Publié: (2025)
par: Chen, Cuiqun, et autres
Publié: (2025)
Show-o: One Single Transformer to Unify Multimodal Understanding and Generation
par: Xie, Jinheng, et autres
Publié: (2024)
par: Xie, Jinheng, et autres
Publié: (2024)
UniG2U-Bench: Do Unified Models Advance Multimodal Understanding?
par: Wen, Zimo, et autres
Publié: (2026)
par: Wen, Zimo, et autres
Publié: (2026)
UniScene: Unified Occupancy-centric Driving Scene Generation
par: Li, Bohan, et autres
Publié: (2024)
par: Li, Bohan, et autres
Publié: (2024)
UniMesh: Unifying 3D Mesh Understanding and Generation
par: Huang, Peng, et autres
Publié: (2026)
par: Huang, Peng, et autres
Publié: (2026)
G$^2$TR: Generation-Guided Visual Token Reduction for Separate-Encoder Unified Multimodal Models
par: Li, Junxian, et autres
Publié: (2026)
par: Li, Junxian, et autres
Publié: (2026)
UniChange: Unifying Change Detection with Multimodal Large Language Model
par: Zhang, Xu, et autres
Publié: (2025)
par: Zhang, Xu, et autres
Publié: (2025)
UniCal: Unified Neural Sensor Calibration
par: Yang, Ze, et autres
Publié: (2024)
par: Yang, Ze, et autres
Publié: (2024)
Ming-Lite-Uni: Advancements in Unified Architecture for Natural Multimodal Interaction
par: AI, Inclusion, et autres
Publié: (2025)
par: AI, Inclusion, et autres
Publié: (2025)
UniRSCD: A Unified Novel Architectural Paradigm for Remote Sensing Change Detection
par: Qu, Yuan, et autres
Publié: (2025)
par: Qu, Yuan, et autres
Publié: (2025)
Uni-Renderer: Unifying Rendering and Inverse Rendering Via Dual Stream Diffusion
par: Chen, Zhifei, et autres
Publié: (2024)
par: Chen, Zhifei, et autres
Publié: (2024)
Design2Code: Benchmarking Multimodal Code Generation for Automated Front-End Engineering
par: Si, Chenglei, et autres
Publié: (2024)
par: Si, Chenglei, et autres
Publié: (2024)
UniVid: The Open-Source Unified Video Model
par: Luo, Jiabin, et autres
Publié: (2025)
par: Luo, Jiabin, et autres
Publié: (2025)
UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding
par: Xu, Yueming, et autres
Publié: (2025)
par: Xu, Yueming, et autres
Publié: (2025)
Uni-MoE: Scaling Unified Multimodal LLMs with Mixture of Experts
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Implicit Neural Representation Facilitates Unified Universal Vision Encoding
par: Gwilliam, Matthew, et autres
Publié: (2026)
par: Gwilliam, Matthew, et autres
Publié: (2026)
UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes
par: Ni, Shuo, et autres
Publié: (2025)
par: Ni, Shuo, et autres
Publié: (2025)
Documents similaires
-
UniCode$^2$: Cascaded Large-scale Codebooks for Unified Multimodal Understanding and Generation
par: Chen, Yanzhe, et autres
Publié: (2025) -
UniMoD: Efficient Unified Multimodal Transformers with Mixture-of-Depths
par: Mao, Weijia, et autres
Publié: (2025) -
UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning
par: Mao, Weijia, et autres
Publié: (2025) -
ProAPO: Progressively Automatic Prompt Optimization for Visual Classification
par: Qu, Xiangyan, et autres
Publié: (2025) -
UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
par: Zhao, Yaqi, et autres
Publié: (2026)