Unified Text-Image Generation with Weakness-Targeted Post-Training
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chen, Jiahui, Hansen-Estruch, Philippe, Han, Xiaochuang, Hu, Yushi, Dinan, Emily, Kamath, Amita, Drozdzal, Michal, Askari-Hemmat, Reyhane, Zettlemoyer, Luke, Ghazvininejad, Marjan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
par: Hu, Yushi, et autres
Publié: (2025)
par: Hu, Yushi, et autres
Publié: (2025)
GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
par: Kamath, Amita, et autres
Publié: (2025)
par: Kamath, Amita, et autres
Publié: (2025)
Multi-Modal Language Models as Text-to-Image Model Evaluators
par: Chen, Jiahui, et autres
Publié: (2025)
par: Chen, Jiahui, et autres
Publié: (2025)
Feedback-guided Data Synthesis for Imbalanced Classification
par: Hemmat, Reyhane Askari, et autres
Publié: (2023)
par: Hemmat, Reyhane Askari, et autres
Publié: (2023)
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
par: Yasunaga, Michihiro, et autres
Publié: (2025)
par: Yasunaga, Michihiro, et autres
Publié: (2025)
TV2TV: A Unified Framework for Interleaved Language and Video Generation
par: Han, Xiaochuang, et autres
Publié: (2025)
par: Han, Xiaochuang, et autres
Publié: (2025)
Improving Geo-diversity of Generated Images with Contextualized Vendi Score Guidance
par: Hemmat, Reyhane Askari, et autres
Publié: (2024)
par: Hemmat, Reyhane Askari, et autres
Publié: (2024)
Why Less is More (Sometimes): A Theory of Data Curation
par: Dohmatob, Elvis, et autres
Publié: (2025)
par: Dohmatob, Elvis, et autres
Publié: (2025)
Inference-time Physics Alignment of Video Generative Models with Latent World Models
par: Yuan, Jianhao, et autres
Publié: (2026)
par: Yuan, Jianhao, et autres
Publié: (2026)
Improving the Physics of Video Generation with VJEPA-2 Reward Signal
par: Yuan, Jianhao, et autres
Publié: (2025)
par: Yuan, Jianhao, et autres
Publié: (2025)
David helps Goliath: Inference-Time Collaboration Between Small Specialized and Large General Diffusion LMs
par: Han, Xiaochuang, et autres
Publié: (2023)
par: Han, Xiaochuang, et autres
Publié: (2023)
Increasing the Utility of Synthetic Images through Chamfer Guidance
par: Dall'Asen, Nicola, et autres
Publié: (2025)
par: Dall'Asen, Nicola, et autres
Publié: (2025)
JPEG-LM: LLMs as Image Generators with Canonical Codec Representations
par: Han, Xiaochuang, et autres
Publié: (2024)
par: Han, Xiaochuang, et autres
Publié: (2024)
Text-Guided Semantic Image Encoder
par: Thirukovalluru, Raghuveer, et autres
Publié: (2025)
par: Thirukovalluru, Raghuveer, et autres
Publié: (2025)
Improving the Scaling Laws of Synthetic Data with Deliberate Practice
par: Askari-Hemmat, Reyhane, et autres
Publié: (2025)
par: Askari-Hemmat, Reyhane, et autres
Publié: (2025)
QGen: On the Ability to Generalize in Quantization Aware Training
par: AskariHemmat, MohammadHossein, et autres
Publié: (2024)
par: AskariHemmat, MohammadHossein, et autres
Publié: (2024)
Self-Improving VLM Judges Without Human Annotations
par: Lin, Inna Wanyin, et autres
Publié: (2025)
par: Lin, Inna Wanyin, et autres
Publié: (2025)
ALMA: Alignment with Minimal Annotation
par: Yasunaga, Michihiro, et autres
Publié: (2024)
par: Yasunaga, Michihiro, et autres
Publié: (2024)
On Improved Conditioning Mechanisms and Pre-training Strategies for Diffusion Models
par: Ifriqi, Tariq Berrada, et autres
Publié: (2024)
par: Ifriqi, Tariq Berrada, et autres
Publié: (2024)
Unified Auto-Encoding with Masked Diffusion
par: Hansen-Estruch, Philippe, et autres
Publié: (2024)
par: Hansen-Estruch, Philippe, et autres
Publié: (2024)
Representation Deficiency in Masked Language Modeling
par: Meng, Yu, et autres
Publié: (2023)
par: Meng, Yu, et autres
Publié: (2023)
Exposing and Addressing Cross-Task Inconsistency in Unified Vision-Language Models
par: Maharana, Adyasha, et autres
Publié: (2023)
par: Maharana, Adyasha, et autres
Publié: (2023)
LMFusion: Adapting Pretrained Language Models for Multimodal Generation
par: Shi, Weijia, et autres
Publié: (2024)
par: Shi, Weijia, et autres
Publié: (2024)
Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge
par: Saha, Swarnadeep, et autres
Publié: (2025)
par: Saha, Swarnadeep, et autres
Publié: (2025)
EvalGIM: A Library for Evaluating Generative Image Models
par: Hall, Melissa, et autres
Publié: (2024)
par: Hall, Melissa, et autres
Publié: (2024)
Fast Byte Latent Transformer
par: Kallini, Julie, et autres
Publié: (2026)
par: Kallini, Julie, et autres
Publié: (2026)
Reconstruction Alignment Improves Unified Multimodal Models
par: Xie, Ji, et autres
Publié: (2025)
par: Xie, Ji, et autres
Publié: (2025)
Los congresos estatales de los Estados Unidos asumen la formulación de políticas públicas
par: Dinan, John
Publié: (2006)
par: Dinan, John
Publié: (2006)
U.S. state capitols take on policy making / John Dinan
par: Dinan, John
Publié: (2006)
par: Dinan, John
Publié: (2006)
reWordBench: Benchmarking and Improving the Robustness of Reward Models with Transformed Inputs
par: Wu, Zhaofeng, et autres
Publié: (2025)
par: Wu, Zhaofeng, et autres
Publié: (2025)
CONTEMPORARY HERMENEUTICS AND THE ROLE OF THE SELF IN TRANSLATION
par: Amrollah Hemmat
Publié: (2009)
par: Amrollah Hemmat
Publié: (2009)
Los suicidios / Joan Estruch, Salvador Cardús
par: Estruch, Joan
Publié: (1982)
par: Estruch, Joan
Publié: (1982)
Fundar, gobernar y rezar. Una aproximación a los vínculos entre sociedad, política y religión en el Jujuy colonial (1656-1776)
par: Dolores Estruch
Publié: (2009)
par: Dolores Estruch
Publié: (2009)
Paula López Caballero y Christophe Giudicelli (eds.), Regímenes de alteridad. Estados-Nación y alteridades indígenas en América Latina, 1810-1950, México, Universidad de los Andes / Universidad Nacional de Villa María / Universidad Nacional Autónoma de México, 2019, 292 páginas
par: Dolores Estruch
Publié: (2020)
par: Dolores Estruch
Publié: (2020)
Similarity Functions for Structured Data.An Application to Decision Trees
par: V. Estruch
Publié: (2006)
par: V. Estruch
Publié: (2006)
Ritual, cambio social y secularización. Un estudio de caso en el Jujuy de fines del período colonial
par: Dolores Estruch
Publié: (2017)
par: Dolores Estruch
Publié: (2017)
LA JUSTICIA Y LA ESPERA EN UNA JURISDICCIÓN COLONIAL EN LOS MÁRGENES DE LA MONARQUÍA, SAN SALVADOR DE JUJUY
par: Dolores Estruch
Publié: (2020)
par: Dolores Estruch
Publié: (2020)
Towards Geographic Inclusion in the Evaluation of Text-to-Image Models
par: Hall, Melissa, et autres
Publié: (2024)
par: Hall, Melissa, et autres
Publié: (2024)
Train for Truth, Keep the Skills: Binary Retrieval-Augmented Reward Mitigates Hallucinations
par: Chen, Tong, et autres
Publié: (2025)
par: Chen, Tong, et autres
Publié: (2025)
Weak well-posedness of stochastic Volterra equations with completely monotone kernels and non-degenerate noise
par: Hamaguchi, Yushi
Publié: (2023)
par: Hamaguchi, Yushi
Publié: (2023)
Documents similaires
-
Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image
par: Hu, Yushi, et autres
Publié: (2025) -
GenEval 2: Addressing Benchmark Drift in Text-to-Image Evaluation
par: Kamath, Amita, et autres
Publié: (2025) -
Multi-Modal Language Models as Text-to-Image Model Evaluators
par: Chen, Jiahui, et autres
Publié: (2025) -
Feedback-guided Data Synthesis for Imbalanced Classification
par: Hemmat, Reyhane Askari, et autres
Publié: (2023) -
Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models
par: Yasunaga, Michihiro, et autres
Publié: (2025)