POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Fan, Yaohou, Wang, Qingzhong, Huang, Yongsong, Liu, Junyi, Miyazaki, Tomo, Omachi, Shinichiro |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
GPSMamba: A Global Phase and Spectral Prompt-guided Mamba for Infrared Image Super-Resolution
par: Huang, Yongsong, et autres
Publié: (2025)
par: Huang, Yongsong, et autres
Publié: (2025)
IRSRMamba: Infrared Image Super-Resolution via Mamba-based Wavelet Transform Feature Modulation Model
par: Huang, Yongsong, et autres
Publié: (2024)
par: Huang, Yongsong, et autres
Publié: (2024)
Infrared Image Super-Resolution: Systematic Review, and Future Trends
par: Huang, Yongsong, et autres
Publié: (2022)
par: Huang, Yongsong, et autres
Publié: (2022)
Texture and Noise Dual Adaptation for Infrared Image Super-Resolution
par: Huang, Yongsong, et autres
Publié: (2023)
par: Huang, Yongsong, et autres
Publié: (2023)
Towards Cross-Domain Multi-Targeted Adversarial Attacks
par: Gonçalves, Taïga, et autres
Publié: (2025)
par: Gonçalves, Taïga, et autres
Publié: (2025)
Controlling Rate, Distortion, and Realism: Towards a Single Comprehensive Neural Image Compression Model
par: Iwai, Shoma, et autres
Publié: (2024)
par: Iwai, Shoma, et autres
Publié: (2024)
Joint Low-level and High-level Textual Representation Learning with Multiple Masking Strategies
par: Tang, Zhengmi, et autres
Publié: (2025)
par: Tang, Zhengmi, et autres
Publié: (2025)
GTFMN: Guided Texture and Feature Modulation Network for Low-Light Image Enhancement and Super-Resolution
par: Huang, Yongsong, et autres
Publié: (2026)
par: Huang, Yongsong, et autres
Publié: (2026)
Class-agnostic 3D Segmentation by Granularity-Consistent Automatic 2D Mask Tracking
par: Wang, Juan, et autres
Publié: (2025)
par: Wang, Juan, et autres
Publié: (2025)
U-Harmony: Enhancing Joint Training for Segmentation Models with Universal Harmonization
par: Ma, Weiwei, et autres
Publié: (2026)
par: Ma, Weiwei, et autres
Publié: (2026)
Pareto-Guided Optimal Transport for Multi-Reward Alignment
par: Ba, Ying, et autres
Publié: (2026)
par: Ba, Ying, et autres
Publié: (2026)
ALPS: An Auto-Labeling and Pre-training Scheme for Remote Sensing Segmentation With Segment Anything Model
par: Zhang, Song, et autres
Publié: (2024)
par: Zhang, Song, et autres
Publié: (2024)
Pareto-Enhanced Portrait Generation: Vision-Aligned Text Supervision for Alignment, Realism, and Aesthetics
par: Wang, Yunlong, et autres
Publié: (2026)
par: Wang, Yunlong, et autres
Publié: (2026)
DiCTI: Diffusion-based Clothing Designer via Text-guided Input
par: Lampe, Ajda, et autres
Publié: (2024)
par: Lampe, Ajda, et autres
Publié: (2024)
Layout-Corrector: Alleviating Layout Sticking Phenomenon in Discrete Diffusion Model
par: Iwai, Shoma, et autres
Publié: (2024)
par: Iwai, Shoma, et autres
Publié: (2024)
Visual Text Generation in the Wild
par: Zhu, Yuanzhi, et autres
Publié: (2024)
par: Zhu, Yuanzhi, et autres
Publié: (2024)
LAGO: Language-Guided Adaptive Object-Region Focus for Zero-Shot Visual-Text Alignment
par: Hu, Junyi, et autres
Publié: (2026)
par: Hu, Junyi, et autres
Publié: (2026)
Synthetic Curriculum Reinforces Compositional Text-to-Image Generation
par: Wang, Shijian, et autres
Publié: (2025)
par: Wang, Shijian, et autres
Publié: (2025)
Native Audio-Visual Alignment for Generation
par: Ji, Longbin, et autres
Publié: (2026)
par: Ji, Longbin, et autres
Publié: (2026)
Fast Prompt Alignment for Text-to-Image Generation
par: Mrini, Khalil, et autres
Publié: (2024)
par: Mrini, Khalil, et autres
Publié: (2024)
Parrot: Pareto-optimal Multi-Reward Reinforcement Learning Framework for Text-to-Image Generation
par: Lee, Seung Hyun, et autres
Publié: (2024)
par: Lee, Seung Hyun, et autres
Publié: (2024)
HOTS3D: Hyper-Spherical Optimal Transport for Semantic Alignment of Text-to-3D Generation
par: Li, Zezeng, et autres
Publié: (2024)
par: Li, Zezeng, et autres
Publié: (2024)
Harmonizing Visual Text Comprehension and Generation
par: Zhao, Zhen, et autres
Publié: (2024)
par: Zhao, Zhen, et autres
Publié: (2024)
Text-Animator: Controllable Visual Text Video Generation
par: Liu, Lin, et autres
Publié: (2024)
par: Liu, Lin, et autres
Publié: (2024)
TiC: Exploring Vision Transformer in Convolution
par: Zhang, Song, et autres
Publié: (2023)
par: Zhang, Song, et autres
Publié: (2023)
InstructEngine: Instruction-driven Text-to-Image Alignment
par: Lu, Xingyu, et autres
Publié: (2025)
par: Lu, Xingyu, et autres
Publié: (2025)
BideDPO: Conditional Image Generation with Simultaneous Text and Condition Alignment
par: Zhou, Dewei, et autres
Publié: (2025)
par: Zhou, Dewei, et autres
Publié: (2025)
Exploring Motion-Language Alignment for Text-driven Motion Generation
par: Gu, Ruxi, et autres
Publié: (2026)
par: Gu, Ruxi, et autres
Publié: (2026)
Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content
par: Zhang, Zicheng, et autres
Publié: (2025)
par: Zhang, Zicheng, et autres
Publié: (2025)
Unleashing the Potential of Large Language Models for Text-to-Image Generation through Autoregressive Representation Alignment
par: Xie, Xing, et autres
Publié: (2025)
par: Xie, Xing, et autres
Publié: (2025)
Zero-Shot Skeleton-based Action Recognition with Dual Visual-Text Alignment
par: Kuang, Jidong, et autres
Publié: (2024)
par: Kuang, Jidong, et autres
Publié: (2024)
SceneVTG++: Controllable Multilingual Visual Text Generation in the Wild
par: Liu, Jiawei, et autres
Publié: (2025)
par: Liu, Jiawei, et autres
Publié: (2025)
GVGEN: Text-to-3D Generation with Volumetric Representation
par: He, Xianglong, et autres
Publié: (2024)
par: He, Xianglong, et autres
Publié: (2024)
Learning Visual Generative Priors without Text
par: Ma, Shuailei, et autres
Publié: (2024)
par: Ma, Shuailei, et autres
Publié: (2024)
Interactive Visual Assessment for Text-to-Image Generation Models
par: Mi, Xiaoyue, et autres
Publié: (2024)
par: Mi, Xiaoyue, et autres
Publié: (2024)
FocusDiff: Advancing Fine-Grained Text-Image Alignment for Autoregressive Visual Generation through RL
par: Pan, Kaihang, et autres
Publié: (2025)
par: Pan, Kaihang, et autres
Publié: (2025)
SpatialV2A: Visual-Guided High-fidelity Spatial Audio Generation
par: Wang, Yanan, et autres
Publié: (2026)
par: Wang, Yanan, et autres
Publié: (2026)
SAN: Structure-Aware Network for Complex and Long-tailed Chinese Text Recognition
par: Zhang, Junyi, et autres
Publié: (2024)
par: Zhang, Junyi, et autres
Publié: (2024)
Can Text-to-Video Generation help Video-Language Alignment?
par: Zanella, Luca, et autres
Publié: (2025)
par: Zanella, Luca, et autres
Publié: (2025)
MTADiffusion: Mask Text Alignment Diffusion Model for Object Inpainting
par: Huang, Jun, et autres
Publié: (2025)
par: Huang, Jun, et autres
Publié: (2025)
Documents similaires
-
GPSMamba: A Global Phase and Spectral Prompt-guided Mamba for Infrared Image Super-Resolution
par: Huang, Yongsong, et autres
Publié: (2025) -
IRSRMamba: Infrared Image Super-Resolution via Mamba-based Wavelet Transform Feature Modulation Model
par: Huang, Yongsong, et autres
Publié: (2024) -
Infrared Image Super-Resolution: Systematic Review, and Future Trends
par: Huang, Yongsong, et autres
Publié: (2022) -
Texture and Noise Dual Adaptation for Infrared Image Super-Resolution
par: Huang, Yongsong, et autres
Publié: (2023) -
Towards Cross-Domain Multi-Targeted Adversarial Attacks
par: Gonçalves, Taïga, et autres
Publié: (2025)