YOLO-Count: Differentiable Object Counting for Text-to-Image Generation
Fuente:
arXiv
Guardado en:
| Autores principales: | Zeng, Guanning, Zhang, Xiang, Wang, Zirui, Xu, Haiyang, Chen, Zeyuan, Li, Bingnan, Tu, Zhuowen |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
OmniControlNet: Dual-stage Integration for Conditional Image Generation
por: Wang, Yilin, et al.
Publicado: (2024)
por: Wang, Yilin, et al.
Publicado: (2024)
OverLayBench: A Benchmark for Layout-to-Image Generation with Dense Overlaps
por: Li, Bingnan, et al.
Publicado: (2025)
por: Li, Bingnan, et al.
Publicado: (2025)
CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
por: Chen, Zeyuan, et al.
Publicado: (2025)
por: Chen, Zeyuan, et al.
Publicado: (2025)
Exploring the Equivalence of Closed-Set Generative and Real Data Augmentation in Image Classification
por: Wang, Haowen, et al.
Publicado: (2025)
por: Wang, Haowen, et al.
Publicado: (2025)
CyCLeGen: Cycle-Consistent Layout Prediction and Image Generation in Vision Foundation Models
por: Shan, Xiaojun, et al.
Publicado: (2026)
por: Shan, Xiaojun, et al.
Publicado: (2026)
TokenCompose: Text-to-Image Diffusion with Token-level Supervision
por: Wang, Zirui, et al.
Publicado: (2023)
por: Wang, Zirui, et al.
Publicado: (2023)
DepR: Depth Guided Single-view Scene Reconstruction with Instance-level Diffusion
por: Zhao, Qingcheng, et al.
Publicado: (2025)
por: Zhao, Qingcheng, et al.
Publicado: (2025)
Bayesian Diffusion Models for 3D Shape Reconstruction
por: Xu, Haiyang, et al.
Publicado: (2024)
por: Xu, Haiyang, et al.
Publicado: (2024)
C3Editor: Achieving Controllable Consistency in 2D Model for 3D Editing
por: Tao, Zeng, et al.
Publicado: (2025)
por: Tao, Zeng, et al.
Publicado: (2025)
CountDiffusion: Text-to-Image Synthesis with Training-Free Counting-Guidance Diffusion
por: Li, Yanyu, et al.
Publicado: (2025)
por: Li, Yanyu, et al.
Publicado: (2025)
Soft Tail-dropping for Adaptive Visual Tokenization
por: Chen, Zeyuan, et al.
Publicado: (2026)
por: Chen, Zeyuan, et al.
Publicado: (2026)
Point, Segment and Count: A Generalized Framework for Object Counting
por: Huang, Zhizhong, et al.
Publicado: (2023)
por: Huang, Zhizhong, et al.
Publicado: (2023)
Gaussian Swaying: Surface-Based Framework for Aerodynamic Simulation with 3D Gaussians
por: Yan, Hongru, et al.
Publicado: (2025)
por: Yan, Hongru, et al.
Publicado: (2025)
Counting Stacked Objects
por: Dumery, Corentin, et al.
Publicado: (2024)
por: Dumery, Corentin, et al.
Publicado: (2024)
Text-promptable Object Counting via Quantity Awareness Enhancement
por: Shi, Miaojing, et al.
Publicado: (2025)
por: Shi, Miaojing, et al.
Publicado: (2025)
Make It Count: Text-to-Image Generation with an Accurate Number of Objects
por: Binyamin, Lital, et al.
Publicado: (2024)
por: Binyamin, Lital, et al.
Publicado: (2024)
Combining YOLO and Visual Rhythm for Vehicle Counting
por: Ribeiro, Victor Nascimento, et al.
Publicado: (2025)
por: Ribeiro, Victor Nascimento, et al.
Publicado: (2025)
CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation
por: Lee, Joohyeon, et al.
Publicado: (2025)
por: Lee, Joohyeon, et al.
Publicado: (2025)
ImageNet3D: Towards General-Purpose Object-Level 3D Understanding
por: Ma, Wufei, et al.
Publicado: (2024)
por: Ma, Wufei, et al.
Publicado: (2024)
CountSteer: Steering Attention for Object Counting in Diffusion Models
por: Boo, Hyemin, et al.
Publicado: (2025)
por: Boo, Hyemin, et al.
Publicado: (2025)
Automated Counting of Stacked Objects in Industrial Inspection
por: Dumery, Corentin, et al.
Publicado: (2026)
por: Dumery, Corentin, et al.
Publicado: (2026)
Plug-and-Play Algorithm Convergence Analysis From The Standpoint of Stochastic Differential Equation
por: Wang, Zhongqi, et al.
Publicado: (2024)
por: Wang, Zhongqi, et al.
Publicado: (2024)
Counting Guidance for High Fidelity Text-to-Image Synthesis
por: Kang, Wonjun, et al.
Publicado: (2023)
por: Kang, Wonjun, et al.
Publicado: (2023)
HOIDiffusion: Generating Realistic 3D Hand-Object Interaction Data
por: Zhang, Mengqi, et al.
Publicado: (2024)
por: Zhang, Mengqi, et al.
Publicado: (2024)
Rethinking Cell Counting Methods: Decoupling Counting and Localization
por: Zheng, Zixuan, et al.
Publicado: (2025)
por: Zheng, Zixuan, et al.
Publicado: (2025)
Learning Spatial Similarity Distribution for Few-shot Object Counting
por: Xu, Yuanwu, et al.
Publicado: (2024)
por: Xu, Yuanwu, et al.
Publicado: (2024)
VLCounter: Text-aware Visual Representation for Zero-Shot Object Counting
por: Kang, Seunggu, et al.
Publicado: (2023)
por: Kang, Seunggu, et al.
Publicado: (2023)
Livestock Fish Larvae Counting using DETR and YOLO based Deep Networks
por: de Carvalho, Daniel Ortega, et al.
Publicado: (2024)
por: de Carvalho, Daniel Ortega, et al.
Publicado: (2024)
Generalized-Scale Object Counting with Gradual Query Aggregation
por: Pelhan, Jer, et al.
Publicado: (2025)
por: Pelhan, Jer, et al.
Publicado: (2025)
Boosting Quantitive and Spatial Awareness for Zero-Shot Object Counting
por: Zhang, Da, et al.
Publicado: (2026)
por: Zhang, Da, et al.
Publicado: (2026)
Diffusion-based Data Augmentation for Object Counting Problems
por: Wang, Zhen, et al.
Publicado: (2024)
por: Wang, Zhen, et al.
Publicado: (2024)
Decoupling What to Count and Where to See for Referring Expression Counting
por: Zou, Yuda, et al.
Publicado: (2025)
por: Zou, Yuda, et al.
Publicado: (2025)
Depth-Assisted Network for Indiscernible Marine Object Counting with Adaptive Motion-Differentiated Feature Encoding
por: Ma, Chengzhi, et al.
Publicado: (2025)
por: Ma, Chengzhi, et al.
Publicado: (2025)
CountGD++: Generalized Prompting for Open-World Counting
por: Amini-Naieni, Niki, et al.
Publicado: (2025)
por: Amini-Naieni, Niki, et al.
Publicado: (2025)
Zero-shot Object Counting with Good Exemplars
por: Zhu, Huilin, et al.
Publicado: (2024)
por: Zhu, Huilin, et al.
Publicado: (2024)
Shifted Autoencoders for Point Annotation Restoration in Object Counting
por: Zou, Yuda, et al.
Publicado: (2023)
por: Zou, Yuda, et al.
Publicado: (2023)
VideoDreamer: Customized Multi-Subject Text-to-Video Generation with Disen-Mix Finetuning on Language-Video Foundation Models
por: Chen, Hong, et al.
Publicado: (2023)
por: Chen, Hong, et al.
Publicado: (2023)
Bootstrapping MLLM for Weakly-Supervised Class-Agnostic Object Counting
por: Zhang, Xiaowen, et al.
Publicado: (2026)
por: Zhang, Xiaowen, et al.
Publicado: (2026)
Does it Really Count? Assessing Semantic Grounding in Text-Guided Class-Agnostic Counting
por: Pacini, Giacomo, et al.
Publicado: (2026)
por: Pacini, Giacomo, et al.
Publicado: (2026)
TFCounter:Polishing Gems for Training-Free Object Counting
por: Ting, Pan, et al.
Publicado: (2024)
por: Ting, Pan, et al.
Publicado: (2024)
Ejemplares similares
-
OmniControlNet: Dual-stage Integration for Conditional Image Generation
por: Wang, Yilin, et al.
Publicado: (2024) -
OverLayBench: A Benchmark for Layout-to-Image Generation with Dense Overlaps
por: Li, Bingnan, et al.
Publicado: (2025) -
CVP: Central-Peripheral Vision-Inspired Multimodal Model for Spatial Reasoning
por: Chen, Zeyuan, et al.
Publicado: (2025) -
Exploring the Equivalence of Closed-Set Generative and Real Data Augmentation in Image Classification
por: Wang, Haowen, et al.
Publicado: (2025) -
CyCLeGen: Cycle-Consistent Layout Prediction and Image Generation in Vision Foundation Models
por: Shan, Xiaojun, et al.
Publicado: (2026)