Enregistré dans:
| Auteurs principaux: | Li, Daiqing, Kamko, Aleks, Akhgari, Ehsan, Sabet, Ali, Xu, Linmiao, Doshi, Suhail |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2402.17245 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models
par: Liu, Bingchen, et autres
Publié: (2024)
par: Liu, Bingchen, et autres
Publié: (2024)
Image Aesthetics Assessment using Multi Channel Convolutional Neural Networks
par: Doshi, Nishi, et autres
Publié: (2019)
par: Doshi, Nishi, et autres
Publié: (2019)
The Photographer Eye: Teaching Multimodal Large Language Models to Understand Image Aesthetics like Photographers
par: Qi, Daiqing, et autres
Publié: (2025)
par: Qi, Daiqing, et autres
Publié: (2025)
Optimizing Negative Prompts for Enhanced Aesthetics and Fidelity in Text-To-Image Generation
par: Ogezi, Michael, et autres
Publié: (2024)
par: Ogezi, Michael, et autres
Publié: (2024)
Visual IRL for Human-Like Robotic Manipulation
par: Asali, Ehsan, et autres
Publié: (2024)
par: Asali, Ehsan, et autres
Publié: (2024)
Bridging Visual Affective Gap: Borrowing Textual Knowledge by Learning from Noisy Image-Text Pairs
par: Wu, Daiqing, et autres
Publié: (2025)
par: Wu, Daiqing, et autres
Publié: (2025)
MVSA-Net: Multi-View State-Action Recognition for Robust and Deployable Trajectory Generation
par: Asali, Ehsan, et autres
Publié: (2023)
par: Asali, Ehsan, et autres
Publié: (2023)
Aesthetic Image Captioning with Saliency Enhanced MLLMs
par: Tao, Yilin, et autres
Publié: (2025)
par: Tao, Yilin, et autres
Publié: (2025)
Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues
par: Zhang, Yan, et autres
Publié: (2024)
par: Zhang, Yan, et autres
Publié: (2024)
Pareto-Enhanced Portrait Generation: Vision-Aligned Text Supervision for Alignment, Realism, and Aesthetics
par: Wang, Yunlong, et autres
Publié: (2026)
par: Wang, Yunlong, et autres
Publié: (2026)
Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text Rendering
par: Liu, Zeyu, et autres
Publié: (2024)
par: Liu, Zeyu, et autres
Publié: (2024)
VRMDiff: Text-Guided Video Referring Matting Generation of Diffusion
par: Yang, Lehan, et autres
Publié: (2025)
par: Yang, Lehan, et autres
Publié: (2025)
AccelAes: Accelerating Diffusion Transformers for Training-Free Aesthetic-Enhanced Image Generation
par: Yin, Xuanhua, et autres
Publié: (2026)
par: Yin, Xuanhua, et autres
Publié: (2026)
Beyond Aesthetics: Cultural Competence in Text-to-Image Models
par: Kannen, Nithish, et autres
Publié: (2024)
par: Kannen, Nithish, et autres
Publié: (2024)
Aesthetics as Structural Harm: Algorithmic Lookism Across Text-to-Image Generation and Classification
par: Doh, Miriam, et autres
Publié: (2026)
par: Doh, Miriam, et autres
Publié: (2026)
Char-SAM: Turning Segment Anything Model into Scene Text Segmentation Annotator with Character-level Visual Prompts
par: Xie, Enze, et autres
Publié: (2024)
par: Xie, Enze, et autres
Publié: (2024)
PEO: Training-Free Aesthetic Quality Enhancement in Pre-Trained Text-to-Image Diffusion Models with Prompt Embedding Optimization
par: Margaryan, Hovhannes, et autres
Publié: (2025)
par: Margaryan, Hovhannes, et autres
Publié: (2025)
Assessing UHD Image Quality from Aesthetics, Distortions, and Saliency
par: Sun, Wei, et autres
Publié: (2024)
par: Sun, Wei, et autres
Publié: (2024)
Beyond Detection: A Structure-Aware Framework for Scene Text Tracking
par: Yu, Chenmin, et autres
Publié: (2026)
par: Yu, Chenmin, et autres
Publié: (2026)
InstantStyle: Free Lunch towards Style-Preserving in Text-to-Image Generation
par: Wang, Haofan, et autres
Publié: (2024)
par: Wang, Haofan, et autres
Publié: (2024)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
par: Jin, Zhe, et autres
Publié: (2025)
par: Jin, Zhe, et autres
Publié: (2025)
Anti-Aesthetics: Protecting Facial Privacy against Customized Text-to-Image Synthesis
par: Wang, Songping, et autres
Publié: (2025)
par: Wang, Songping, et autres
Publié: (2025)
Advancing Aesthetic Image Generation via Composition Transfer
par: Zou, Kai, et autres
Publié: (2026)
par: Zou, Kai, et autres
Publié: (2026)
Advancing Comprehensive Aesthetic Insight with Multi-Scale Text-Guided Self-Supervised Learning
par: Liu, Yuti, et autres
Publié: (2024)
par: Liu, Yuti, et autres
Publié: (2024)
UniQA: Unified Vision-Language Pre-training for Image Quality and Aesthetic Assessment
par: Zhou, Hantao, et autres
Publié: (2024)
par: Zhou, Hantao, et autres
Publié: (2024)
GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts
par: He, Junwen, et autres
Publié: (2024)
par: He, Junwen, et autres
Publié: (2024)
Aesthetic Camera Viewpoint Suggestion with 3D Aesthetic Field
par: Tang, Sheyang, et autres
Publié: (2026)
par: Tang, Sheyang, et autres
Publié: (2026)
Text2QR: Harmonizing Aesthetic Customization and Scanning Robustness for Text-Guided QR Code Generation
par: Wu, Guangyang, et autres
Publié: (2024)
par: Wu, Guangyang, et autres
Publié: (2024)
SA-IQA: Redefining Image Quality Assessment for Spatial Aesthetics with Multi-Dimensional Rewards
par: Gao, Yuan, et autres
Publié: (2025)
par: Gao, Yuan, et autres
Publié: (2025)
Spectral Image Tokenizer
par: Esteves, Carlos, et autres
Publié: (2024)
par: Esteves, Carlos, et autres
Publié: (2024)
PosterCraft: Rethinking High-Quality Aesthetic Poster Generation in a Unified Framework
par: Chen, SiXiang, et autres
Publié: (2025)
par: Chen, SiXiang, et autres
Publié: (2025)
One Model, Two Minds: Task-Conditioned Reasoning for Unified Image Quality and Aesthetic Assessment
par: Yin, Wen, et autres
Publié: (2026)
par: Yin, Wen, et autres
Publié: (2026)
Next Token Is Enough: Realistic Image Quality and Aesthetic Scoring with Multimodal Large Language Model
par: Li, Mingxing, et autres
Publié: (2025)
par: Li, Mingxing, et autres
Publié: (2025)
Enhancing Image Aesthetics with Dual-Conditioned Diffusion Models Guided by Multimodal Perception
par: Nan, Xinyu, et autres
Publié: (2026)
par: Nan, Xinyu, et autres
Publié: (2026)
EmoCaliber: Advancing Reliable Visual Emotion Comprehension via Confidence Verbalization and Calibration
par: Wu, Daiqing, et autres
Publié: (2025)
par: Wu, Daiqing, et autres
Publié: (2025)
G-Refine: A General Quality Refiner for Text-to-Image Generation
par: Li, Chunyi, et autres
Publié: (2024)
par: Li, Chunyi, et autres
Publié: (2024)
A Survey on Quality Metrics for Text-to-Image Generation
par: Hartwig, Sebastian, et autres
Publié: (2024)
par: Hartwig, Sebastian, et autres
Publié: (2024)
UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture
par: Cao, Shuo, et autres
Publié: (2025)
par: Cao, Shuo, et autres
Publié: (2025)
Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation
par: Huang, Binyuan, et autres
Publié: (2026)
par: Huang, Binyuan, et autres
Publié: (2026)
An Order-Complexity Aesthetic Assessment Model for Aesthetic-aware Music Recommendation
par: Jin, Xin, et autres
Publié: (2024)
par: Jin, Xin, et autres
Publié: (2024)
Documents similaires
-
Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models
par: Liu, Bingchen, et autres
Publié: (2024) -
Image Aesthetics Assessment using Multi Channel Convolutional Neural Networks
par: Doshi, Nishi, et autres
Publié: (2019) -
The Photographer Eye: Teaching Multimodal Large Language Models to Understand Image Aesthetics like Photographers
par: Qi, Daiqing, et autres
Publié: (2025) -
Optimizing Negative Prompts for Enhanced Aesthetics and Fidelity in Text-To-Image Generation
par: Ogezi, Michael, et autres
Publié: (2024) -
Visual IRL for Human-Like Robotic Manipulation
par: Asali, Ehsan, et autres
Publié: (2024)