VersaT2I: Improving Text-to-Image Models with Versatile Reward
Fuente:
arXiv
Saved in:
| Main Authors: | Guo, Jianshu, Chai, Wenhao, Deng, Jie, Huang, Hsiang-Wei, Ye, Tian, Xu, Yichen, Zhang, Jiawei, Hwang, Jenq-Neng, Wang, Gaoang |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
CityGen: Infinite and Controllable City Layout Generation
by: Deng, Jie, et al.
Published: (2023)
by: Deng, Jie, et al.
Published: (2023)
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
by: Song, Enxin, et al.
Published: (2024)
by: Song, Enxin, et al.
Published: (2024)
MPM: A Unified 2D-3D Human Pose Representation via Masked Pose Modeling
by: Zhang, Zhenyu, et al.
Published: (2023)
by: Zhang, Zhenyu, et al.
Published: (2023)
Recent Advances in Embedding Methods for Multi-Object Tracking: A Survey
by: Wang, Gaoang, et al.
Published: (2022)
by: Wang, Gaoang, et al.
Published: (2022)
CityCraft: A Real Crafter for 3D City Generation
by: Deng, Jie, et al.
Published: (2024)
by: Deng, Jie, et al.
Published: (2024)
PackDiT: Joint Human Motion and Text Generation via Mutual Prompting
by: Jiang, Zhongyu, et al.
Published: (2025)
by: Jiang, Zhongyu, et al.
Published: (2025)
Pointmap Association and Piecewise-Plane Constraint for Consistent and Compact 3D Gaussian Segmentation Field
by: Hu, Wenhao, et al.
Published: (2025)
by: Hu, Wenhao, et al.
Published: (2025)
SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory
by: Yang, Cheng-Yen, et al.
Published: (2024)
by: Yang, Cheng-Yen, et al.
Published: (2024)
MambaMOT: State-Space Model as Motion Predictor for Multi-Object Tracking
by: Huang, Hsiang-Wei, et al.
Published: (2024)
by: Huang, Hsiang-Wei, et al.
Published: (2024)
ToSA: Token Merging with Spatial Awareness
by: Huang, Hsiang-Wei, et al.
Published: (2025)
by: Huang, Hsiang-Wei, et al.
Published: (2025)
Reasoning Matters for 3D Visual Grounding
by: Huang, Hsiang-Wei, et al.
Published: (2026)
by: Huang, Hsiang-Wei, et al.
Published: (2026)
Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System
by: Huang, Hsiang-Wei, et al.
Published: (2026)
by: Huang, Hsiang-Wei, et al.
Published: (2026)
Technical Report for ReID-SAM on SkiTB Visual Tracking Challenge 2025
by: Li, Kunjun, et al.
Published: (2025)
by: Li, Kunjun, et al.
Published: (2025)
VersaGen: Unleashing Versatile Visual Control for Text-to-Image Synthesis
by: Chen, Zhipeng, et al.
Published: (2024)
by: Chen, Zhipeng, et al.
Published: (2024)
ProTPS: Prototype-Guided Text Prompt Selection for Continual Learning
by: Mei, Jie, et al.
Published: (2026)
by: Mei, Jie, et al.
Published: (2026)
Understanding Identity Continuity in Thermal Video through Scene-Level Consistency
by: Sun, Wei-Chieh, et al.
Published: (2026)
by: Sun, Wei-Chieh, et al.
Published: (2026)
MovieChat: From Dense Token to Sparse Memory for Long Video Understanding
by: Song, Enxin, et al.
Published: (2023)
by: Song, Enxin, et al.
Published: (2023)
GTA: Global Tracklet Association for Multi-Object Tracking in Sports
by: Sun, Jiacheng, et al.
Published: (2024)
by: Sun, Jiacheng, et al.
Published: (2024)
UniHPR: Unified Human Pose Representation via Singular Value Contrastive Learning
by: Jiang, Zhongyu, et al.
Published: (2025)
by: Jiang, Zhongyu, et al.
Published: (2025)
RT-Pose: A 4D Radar Tensor-based 3D Human Pose Estimation and Localization Benchmark
by: Ho, Yuan-Hao, et al.
Published: (2024)
by: Ho, Yuan-Hao, et al.
Published: (2024)
DAug: Diffusion-based Channel Augmentation for Radiology Image Retrieval and Classification
by: Jin, Ying, et al.
Published: (2024)
by: Jin, Ying, et al.
Published: (2024)
A Density-Guided Temporal Attention Transformer for Indiscernible Object Counting in Underwater Video
by: Yang, Cheng-Yen, et al.
Published: (2024)
by: Yang, Cheng-Yen, et al.
Published: (2024)
Boosting Online 3D Multi-Object Tracking through Camera-Radar Cross Check
by: Kuan, Sheng-Yao, et al.
Published: (2024)
by: Kuan, Sheng-Yao, et al.
Published: (2024)
CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models
by: Huang, Hsiang-Wei, et al.
Published: (2026)
by: Huang, Hsiang-Wei, et al.
Published: (2026)
LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound
by: Guo, Xuechen, et al.
Published: (2024)
by: Guo, Xuechen, et al.
Published: (2024)
AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding
by: Xu, Weili, et al.
Published: (2025)
by: Xu, Weili, et al.
Published: (2025)
Hierarchical Auto-Organizing System for Open-Ended Multi-Agent Navigation
by: Zhao, Zhonghan, et al.
Published: (2024)
by: Zhao, Zhonghan, et al.
Published: (2024)
Exploring Probabilistic Modeling Beyond Domain Generalization for Semantic Segmentation
by: Chen, I-Hsiang, et al.
Published: (2025)
by: Chen, I-Hsiang, et al.
Published: (2025)
Attention Consistency for LLMs Explanation
by: Lan, Tian, et al.
Published: (2025)
by: Lan, Tian, et al.
Published: (2025)
User-Aware Prefix-Tuning is a Good Learner for Personalized Image Captioning
by: Wang, Xuan, et al.
Published: (2023)
by: Wang, Xuan, et al.
Published: (2023)
Blind Inpainting with Object-aware Discrimination for Artificial Marker Removal
by: Guo, Xuechen, et al.
Published: (2023)
by: Guo, Xuechen, et al.
Published: (2023)
TVMC: Time-Varying Mesh Compression via Multi-Stage Anchor Mesh Generation
by: Huang, He, et al.
Published: (2025)
by: Huang, He, et al.
Published: (2025)
ToddlerAct: A Toddler Action Recognition Dataset for Gross Motor Development Assessment
by: Huang, Hsiang-Wei, et al.
Published: (2024)
by: Huang, Hsiang-Wei, et al.
Published: (2024)
EVAN: Evolutional Video Streaming Adaptation via Neural Representation
by: Liu, Mufan, et al.
Published: (2024)
by: Liu, Mufan, et al.
Published: (2024)
Memory-Efficient Visual Autoregressive Modeling with Scale-Aware KV Cache Compression
by: Li, Kunjun, et al.
Published: (2025)
by: Li, Kunjun, et al.
Published: (2025)
Detector-in-the-Loop Tracking: Active Memory Rectification for Stable Glottic Opening Localization
by: Wang, Huayu, et al.
Published: (2026)
by: Wang, Huayu, et al.
Published: (2026)
AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark
by: Chai, Wenhao, et al.
Published: (2024)
by: Chai, Wenhao, et al.
Published: (2024)
From Global to Local: Rethinking CLIP Feature Aggregation for Person Re-Identification
by: Zheng, Aotian, et al.
Published: (2026)
by: Zheng, Aotian, et al.
Published: (2026)
See and Think: Embodied Agent in Virtual Environment
by: Zhao, Zhonghan, et al.
Published: (2023)
by: Zhao, Zhonghan, et al.
Published: (2023)
Adapting SAM 2 for Visual Object Tracking: 1st Place Solution for MMVPR Challenge Multi-Modal Tracking
by: Yang, Cheng-Yen, et al.
Published: (2025)
by: Yang, Cheng-Yen, et al.
Published: (2025)
Similar Items
-
CityGen: Infinite and Controllable City Layout Generation
by: Deng, Jie, et al.
Published: (2023) -
MovieChat+: Question-aware Sparse Memory for Long Video Question Answering
by: Song, Enxin, et al.
Published: (2024) -
MPM: A Unified 2D-3D Human Pose Representation via Masked Pose Modeling
by: Zhang, Zhenyu, et al.
Published: (2023) -
Recent Advances in Embedding Methods for Multi-Object Tracking: A Survey
by: Wang, Gaoang, et al.
Published: (2022) -
CityCraft: A Real Crafter for 3D City Generation
by: Deng, Jie, et al.
Published: (2024)