Embedding an Ethical Mind: Aligning Text-to-Image Synthesis via Lightweight Value Optimization
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Xingqi, Yi, Xiaoyuan, Xie, Xing, Jia, Jia |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
par: Wu, Yi, et autres
Publié: (2025)
par: Wu, Yi, et autres
Publié: (2025)
Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative Framework
par: Arkhipkin, Vladimir, et autres
Publié: (2024)
par: Arkhipkin, Vladimir, et autres
Publié: (2024)
TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention
par: Shi, Chuancheng, et autres
Publié: (2026)
par: Shi, Chuancheng, et autres
Publié: (2026)
Concept Conductor: Orchestrating Multiple Personalized Concepts in Text-to-Image Synthesis
par: Yao, Zebin, et autres
Publié: (2024)
par: Yao, Zebin, et autres
Publié: (2024)
ObjFormer: Learning Land-Cover Changes From Paired OSM Data and Optical High-Resolution Imagery via Object-Guided Transformer
par: Chen, Hongruixuan, et autres
Publié: (2023)
par: Chen, Hongruixuan, et autres
Publié: (2023)
Audio Visual Segmentation Through Text Embeddings
par: Lee, Kyungbok, et autres
Publié: (2025)
par: Lee, Kyungbok, et autres
Publié: (2025)
A User-Friendly Framework for Generating Model-Preferred Prompts in Text-to-Image Synthesis
par: Hei, Nailei, et autres
Publié: (2024)
par: Hei, Nailei, et autres
Publié: (2024)
Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations
par: Han, Jiaming, et autres
Publié: (2025)
par: Han, Jiaming, et autres
Publié: (2025)
Image Conductor: Precision Control for Interactive Video Synthesis
par: Li, Yaowei, et autres
Publié: (2024)
par: Li, Yaowei, et autres
Publié: (2024)
Can LLMs Create Legally Relevant Summaries and Analyses of Videos?
par: Hoeben-Kuil, Lyra, et autres
Publié: (2025)
par: Hoeben-Kuil, Lyra, et autres
Publié: (2025)
Harmful YouTube Video Detection: A Taxonomy of Online Harm and MLLMs as Alternative Annotators
par: Jo, Claire Wonjeong, et autres
Publié: (2024)
par: Jo, Claire Wonjeong, et autres
Publié: (2024)
KI-Bilder und die Widerständigkeit der Medienkonvergenz: Von primärer zu sekundärer Intermedialität?
par: Wilde, Lukas R. A.
Publié: (2024)
par: Wilde, Lukas R. A.
Publié: (2024)
Towards nation-wide analytical healthcare infrastructures: A privacy-preserving augmented knee rehabilitation case study
par: Bačić, Boris, et autres
Publié: (2024)
par: Bačić, Boris, et autres
Publié: (2024)
AI-based System for Transforming text and sound to Educational Videos
par: ElAlami, M. E., et autres
Publié: (2026)
par: ElAlami, M. E., et autres
Publié: (2026)
Text-Only Data Synthesis for Vision Language Model Training
par: Yu, Xiaomin, et autres
Publié: (2025)
par: Yu, Xiaomin, et autres
Publié: (2025)
AlignDiT: Multimodal Aligned Diffusion Transformer for Synchronized Speech Generation
par: Choi, Jeongsoo, et autres
Publié: (2025)
par: Choi, Jeongsoo, et autres
Publié: (2025)
Efficient Low-Resolution Face Recognition via Bridge Distillation
par: Ge, Shiming, et autres
Publié: (2024)
par: Ge, Shiming, et autres
Publié: (2024)
ScaleDreamer: Scalable Text-to-3D Synthesis with Asynchronous Score Distillation
par: Ma, Zhiyuan, et autres
Publié: (2024)
par: Ma, Zhiyuan, et autres
Publié: (2024)
Truth in the Few: High-Value Data Selection for Efficient Multi-Modal Reasoning
par: Li, Shenshen, et autres
Publié: (2025)
par: Li, Shenshen, et autres
Publié: (2025)
Revolutionizing Text-to-Image Retrieval as Autoregressive Token-to-Voken Generation
par: Li, Yongqi, et autres
Publié: (2024)
par: Li, Yongqi, et autres
Publié: (2024)
One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation
par: Lu, Shuo, et autres
Publié: (2026)
par: Lu, Shuo, et autres
Publié: (2026)
PFB-Diff: Progressive Feature Blending Diffusion for Text-driven Image Editing
par: Huang, Wenjing, et autres
Publié: (2023)
par: Huang, Wenjing, et autres
Publié: (2023)
Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
par: S, Sridhar, et autres
Publié: (2025)
par: S, Sridhar, et autres
Publié: (2025)
Graph-Based Cross-Domain Knowledge Distillation for Cross-Dataset Text-to-Image Person Retrieval
par: Luo, Bingjun, et autres
Publié: (2025)
par: Luo, Bingjun, et autres
Publié: (2025)
End-to-End Optimized Image Compression with the Frequency-Oriented Transform
par: Zhang, Yuefeng, et autres
Publié: (2024)
par: Zhang, Yuefeng, et autres
Publié: (2024)
Discriminative Probing and Tuning for Text-to-Image Generation
par: Qu, Leigang, et autres
Publié: (2024)
par: Qu, Leigang, et autres
Publié: (2024)
PoseTalk: Text-and-Audio-based Pose Control and Motion Refinement for One-Shot Talking Head Generation
par: Ling, Jun, et autres
Publié: (2024)
par: Ling, Jun, et autres
Publié: (2024)
Revisiting Image Captioning Training Paradigm via Direct CLIP-based Optimization
par: Moratelli, Nicholas, et autres
Publié: (2024)
par: Moratelli, Nicholas, et autres
Publié: (2024)
Mitigating Hallucination in Multimodal Large Language Model via Hallucination-targeted Direct Preference Optimization
par: Fu, Yuhan, et autres
Publié: (2024)
par: Fu, Yuhan, et autres
Publié: (2024)
SNIFFER: Multimodal Large Language Model for Explainable Out-of-Context Misinformation Detection
par: Qi, Peng, et autres
Publié: (2024)
par: Qi, Peng, et autres
Publié: (2024)
MORALISE: A Structured Benchmark for Moral Alignment in Visual Language Models
par: Lin, Xiao, et autres
Publié: (2025)
par: Lin, Xiao, et autres
Publié: (2025)
Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion
par: Lv, Zheqi, et autres
Publié: (2025)
par: Lv, Zheqi, et autres
Publié: (2025)
OVFoodSeg: Elevating Open-Vocabulary Food Image Segmentation via Image-Informed Textual Representation
par: Wu, Xiongwei, et autres
Publié: (2024)
par: Wu, Xiongwei, et autres
Publié: (2024)
Dual-Modal Attention-Enhanced Text-Video Retrieval with Triplet Partial Margin Contrastive Learning
par: Jiang, Chen, et autres
Publié: (2023)
par: Jiang, Chen, et autres
Publié: (2023)
OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions
par: Zhang, Yi-Kai, et autres
Publié: (2024)
par: Zhang, Yi-Kai, et autres
Publié: (2024)
High-fidelity and Lip-synced Talking Face Synthesis via Landmark-based Diffusion Model
par: Zhong, Weizhi, et autres
Publié: (2024)
par: Zhong, Weizhi, et autres
Publié: (2024)
FIGURA: A Modular Prompt Engineering Method for Artistic Figure Photography in Safety-Filtered Text-to-Image Models
par: Cazzaniga, Luca
Publié: (2026)
par: Cazzaniga, Luca
Publié: (2026)
GaussianCross: Cross-modal Self-supervised 3D Representation Learning via Gaussian Splatting
par: Yao, Lei, et autres
Publié: (2025)
par: Yao, Lei, et autres
Publié: (2025)
Composing Concepts from Images and Videos via Concept-prompt Binding
par: Kong, Xianghao, et autres
Publié: (2025)
par: Kong, Xianghao, et autres
Publié: (2025)
Evaluating Semantic Variation in Text-to-Image Synthesis: A Causal Perspective
par: Zhu, Xiangru, et autres
Publié: (2024)
par: Zhu, Xiangru, et autres
Publié: (2024)
Documents similaires
-
StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation
par: Wu, Yi, et autres
Publié: (2025) -
Kandinsky 3: Text-to-Image Synthesis for Multifunctional Generative Framework
par: Arkhipkin, Vladimir, et autres
Publié: (2024) -
TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention
par: Shi, Chuancheng, et autres
Publié: (2026) -
Concept Conductor: Orchestrating Multiple Personalized Concepts in Text-to-Image Synthesis
par: Yao, Zebin, et autres
Publié: (2024) -
ObjFormer: Learning Land-Cover Changes From Paired OSM Data and Optical High-Resolution Imagery via Object-Guided Transformer
par: Chen, Hongruixuan, et autres
Publié: (2023)