LAION-SG: An Enhanced Large-Scale Dataset for Training Complex Image-Text Models with Structural Annotations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Zejian, Meng, Chenye, Li, Yize, Yang, Ling, Zhang, Shengyuan, Ma, Jiarui, Li, Jiayi, Yang, Guang, Yang, Changyuan, Yang, Zhiyuan, Chang, Jinxiong, Sun, Lingyun |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Inversion-DPO: Precise and Efficient Post-Training for Diffusion Models
par: Li, Zejian, et autres
Publié: (2025)
par: Li, Zejian, et autres
Publié: (2025)
Distribution Backtracking Builds A Faster Convergence Trajectory for Diffusion Distillation
par: Zhang, Shengyuan, et autres
Publié: (2024)
par: Zhang, Shengyuan, et autres
Publié: (2024)
Beyond Binary Preference: Aligning Diffusion Models to Fine-grained Criteria by Decoupling Attributes
par: Meng, Chenye, et autres
Publié: (2026)
par: Meng, Chenye, et autres
Publié: (2026)
Distilling Diffusion Models to Efficient 3D LiDAR Scene Completion
par: Zhang, Shengyuan, et autres
Publié: (2024)
par: Zhang, Shengyuan, et autres
Publié: (2024)
Diffusion Distillation With Direct Preference Optimization For Efficient 3D LiDAR Scene Completion
par: Zhao, An, et autres
Publié: (2025)
par: Zhao, An, et autres
Publié: (2025)
LAION-C: An Out-of-Distribution Benchmark for Web-Scale Vision Models
par: Li, Fanfei, et autres
Publié: (2025)
par: Li, Fanfei, et autres
Publié: (2025)
Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models
par: Girrbach, Leander, et autres
Publié: (2025)
par: Girrbach, Leander, et autres
Publié: (2025)
Structured Captions Improve Prompt Adherence in Text-to-Image Models (Re-LAION-Caption 19M)
par: Merchant, Nicholas, et autres
Publié: (2025)
par: Merchant, Nicholas, et autres
Publié: (2025)
Optimal plug-in Gaussian processes for modeling derivatives
par: Liu, Zejian, et autres
Publié: (2022)
par: Liu, Zejian, et autres
Publié: (2022)
Multiscale Synergistic Mechanism Study on the Regulation of Resistive Response Stability and Mechanical Behavior of Graphene/ EPDM Rubber Composite Materials
par: Yichen Wu, et autres
Publié: (2025)
par: Yichen Wu, et autres
Publié: (2025)
Intramural Ectopic Pregnancy Diagnosed by Transvaginal Three‐Dimensional Ultrasound: A Case Report and Literature Review
par: Hua Yang, et autres
Publié: (2025)
par: Hua Yang, et autres
Publié: (2025)
SAN: Structure-Aware Network for Complex and Long-tailed Chinese Text Recognition
par: Zhang, Junyi, et autres
Publié: (2024)
par: Zhang, Junyi, et autres
Publié: (2024)
MTPChat: A Multimodal Time-Aware Persona Dataset for Conversational Agents
par: Yang, Wanqi, et autres
Publié: (2025)
par: Yang, Wanqi, et autres
Publié: (2025)
VidGen-1M: A Large-Scale Dataset for Text-to-video Generation
par: Tan, Zhiyu, et autres
Publié: (2024)
par: Tan, Zhiyu, et autres
Publié: (2024)
An evolutionary approach for discovering non-Gaussian stochastic dynamical systems based on nonlocal Kramers-Moyal formulas
par: Li, Yang, et autres
Publié: (2024)
par: Li, Yang, et autres
Publié: (2024)
Rare events in a stochastic vegetation-water dynamical system based on machine learning
par: Li, Yang, et autres
Publié: (2024)
par: Li, Yang, et autres
Publié: (2024)
SpecDM: Hyperspectral Dataset Synthesis with Pixel-level Semantic Annotations
par: Liu, Wendi, et autres
Publié: (2025)
par: Liu, Wendi, et autres
Publié: (2025)
Unconventional Scalings of Quantum Entropies in Long-Range Heisenberg Chains
par: Zhao, Jiarui, et autres
Publié: (2024)
par: Zhao, Jiarui, et autres
Publié: (2024)
Scaling Law for Time-Reversal-Odd Nonlinear Transport
par: Huang, Yue-Xin, et autres
Publié: (2023)
par: Huang, Yue-Xin, et autres
Publié: (2023)
Screening for the Breast Cancer‐Associated Volatile Organic Compounds by GC–MS With Solid Phase Microextraction
par: Yu Zhang, et autres
Publié: (2025)
par: Yu Zhang, et autres
Publié: (2025)
ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving
par: Peng, Qihang, et autres
Publié: (2025)
par: Peng, Qihang, et autres
Publié: (2025)
What Makes ImageNet Look Unlike LAION
par: Shirali, Ali, et autres
Publié: (2023)
par: Shirali, Ali, et autres
Publié: (2023)
The MSR-Video to Text Dataset with Clean Annotations
par: Chen, Haoran, et autres
Publié: (2021)
par: Chen, Haoran, et autres
Publié: (2021)
Training-free Subject-Enhanced Attention Guidance for Compositional Text-to-image Generation
par: Liu, Shengyuan, et autres
Publié: (2024)
par: Liu, Shengyuan, et autres
Publié: (2024)
PACE: A Large-Scale Dataset with Pose Annotations in Cluttered Environments
par: You, Yang, et autres
Publié: (2023)
par: You, Yang, et autres
Publié: (2023)
Unifying Structured Data as Graph for Data-to-Text Pre-Training
par: Li, Shujie, et autres
Publié: (2024)
par: Li, Shujie, et autres
Publié: (2024)
Property-Driven Evaluation of GNN Expressiveness at Scale: Datasets, Framework, and Study
par: Che, Sicong, et autres
Publié: (2026)
par: Che, Sicong, et autres
Publié: (2026)
Surface Acoustic Wave Manipulation of Magnetic Skyrmions for Tunable Nanoscale Oscillators (Adv. Phys. Res. 8/2025)
par: Yang Yang, et autres
Publié: (2025)
par: Yang Yang, et autres
Publié: (2025)
QuadFM: Foundational Text-Driven Quadruped Motion Dataset for Generation and Control
par: Gao, Li, et autres
Publié: (2026)
par: Gao, Li, et autres
Publié: (2026)
Multi-dimensional Backward Stochastic Differential Equations of Diagonally Quadratic Generators with a Special Structure
par: Yang, Guang
Publié: (2023)
par: Yang, Guang
Publié: (2023)
DreamRenderer: Taming Multi-Instance Attribute Control in Large-Scale Text-to-Image Models
par: Zhou, Dewei, et autres
Publié: (2025)
par: Zhou, Dewei, et autres
Publié: (2025)
Zirconium‐porphyrin‐MOF‐based oxidase‐like nanozyme with oxygen vacancy for aflatoxin B1 colorimetric sensing
par: Shengyuan Zhang, et autres
Publié: (2024)
par: Shengyuan Zhang, et autres
Publié: (2024)
Context-Sensitive Pointer Analysis for ArkTS
par: Yang, Yizhuo, et autres
Publié: (2026)
par: Yang, Yizhuo, et autres
Publié: (2026)
VideoUFO: A Million-Scale User-Focused Dataset for Text-to-Video Generation
par: Wang, Wenhao, et autres
Publié: (2025)
par: Wang, Wenhao, et autres
Publié: (2025)
OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation
par: Nan, Kepan, et autres
Publié: (2024)
par: Nan, Kepan, et autres
Publié: (2024)
Knots: A Large-Scale Multi-Agent Enhanced Expert-Annotated Dataset and LLM Prompt Optimization for NOTAM Semantic Parsing
par: Liu, Maoqi, et autres
Publié: (2025)
par: Liu, Maoqi, et autres
Publié: (2025)
Jointly Learning Structured Representations and Stabilized Affinity for Human Motion Segmentation
par: Meng, Xianghan, et autres
Publié: (2026)
par: Meng, Xianghan, et autres
Publié: (2026)
RATE: Reviewer Profiling and Annotation-free Training for Expertise Ranking in Peer Review Systems
par: Liu, Weicong, et autres
Publié: (2026)
par: Liu, Weicong, et autres
Publié: (2026)
TrimR: Verifier-based Training-Free Thinking Compression for Efficient Test-Time Scaling
par: Lin, Weizhe, et autres
Publié: (2025)
par: Lin, Weizhe, et autres
Publié: (2025)
Decision Machines: Congruent Decision Trees
par: Zhang, Jinxiong
Publié: (2021)
par: Zhang, Jinxiong
Publié: (2021)
Documents similaires
-
Inversion-DPO: Precise and Efficient Post-Training for Diffusion Models
par: Li, Zejian, et autres
Publié: (2025) -
Distribution Backtracking Builds A Faster Convergence Trajectory for Diffusion Distillation
par: Zhang, Shengyuan, et autres
Publié: (2024) -
Beyond Binary Preference: Aligning Diffusion Models to Fine-grained Criteria by Decoupling Attributes
par: Meng, Chenye, et autres
Publié: (2026) -
Distilling Diffusion Models to Efficient 3D LiDAR Scene Completion
par: Zhang, Shengyuan, et autres
Publié: (2024) -
Diffusion Distillation With Direct Preference Optimization For Efficient 3D LiDAR Scene Completion
par: Zhao, An, et autres
Publié: (2025)