Low-Biased General Annotated Dataset Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Jiang, Dengyang, Wang, Haoyu, Zhang, Lei, Wei, Wei, Dai, Guang, Wang, Mengmeng, Wang, Jingdong, Zhang, Yanning |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
JoDiffusion: Jointly Diffusing Image with Pixel-Level Annotations for Semantic Segmentation Promotion
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2026)
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2026)
AffordanceSAM: Segment Anything Once More in Affordance Grounding
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
di: Jiang, Dengyang, et al.
Pubblicazione: (2025)
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
di: Wang, Zanyi, et al.
Pubblicazione: (2025)
di: Wang, Zanyi, et al.
Pubblicazione: (2025)
SRA 2: Variational Autoencoder Self-Representation Alignment for Efficient Diffusion Training
di: Wang, Mengmeng, et al.
Pubblicazione: (2026)
di: Wang, Mengmeng, et al.
Pubblicazione: (2026)
Unlocking the Potential of Grounding DINO in Videos: Parameter-Efficient Adaptation for Limited-Data Spatial-Temporal Localization
di: Wang, Zanyi, et al.
Pubblicazione: (2026)
di: Wang, Zanyi, et al.
Pubblicazione: (2026)
Prompt-Free Conditional Diffusion for Multi-object Image Augmentation
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
di: Wang, Haoyu, et al.
Pubblicazione: (2025)
SpotActor: Training-Free Layout-Controlled Consistent Image Generation
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
Flipped Classroom: Aligning Teacher Attention with Student in Generalized Category Discovery
di: Lin, Haonan, et al.
Pubblicazione: (2024)
di: Lin, Haonan, et al.
Pubblicazione: (2024)
DreamSalon: A Staged Diffusion Framework for Preserving Identity-Context in Editable Face Generation
di: Lin, Haonan, et al.
Pubblicazione: (2024)
di: Lin, Haonan, et al.
Pubblicazione: (2024)
UniTriGen: Unified Triplet Generation of Aligned Visible-Infrared-Label for Few-Shot RGB-T Semantic Segmentation
di: Zhou, Ping, et al.
Pubblicazione: (2026)
di: Zhou, Ping, et al.
Pubblicazione: (2026)
SSMG: Spatial-Semantic Map Guided Diffusion Model for Free-form Layout-to-Image Generation
di: Jia, Chengyou, et al.
Pubblicazione: (2023)
di: Jia, Chengyou, et al.
Pubblicazione: (2023)
GeoLoom: High-quality Geometric Diagram Generation from Textual Input
di: Wei, Xiaojing, et al.
Pubblicazione: (2025)
di: Wei, Xiaojing, et al.
Pubblicazione: (2025)
TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
di: Li, Fan, et al.
Pubblicazione: (2025)
di: Li, Fan, et al.
Pubblicazione: (2025)
C3L: Content Correlated Vision-Language Instruction Tuning Data Generation via Contrastive Learning
di: Ma, Ji, et al.
Pubblicazione: (2024)
di: Ma, Ji, et al.
Pubblicazione: (2024)
M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
MA-FSAR: Multimodal Adaptation of CLIP for Few-Shot Action Recognition
di: Xing, Jiazheng, et al.
Pubblicazione: (2023)
di: Xing, Jiazheng, et al.
Pubblicazione: (2023)
Schedule Your Edit: A Simple yet Effective Diffusion Noise Schedule for Image Editing
di: Lin, Haonan, et al.
Pubblicazione: (2024)
di: Lin, Haonan, et al.
Pubblicazione: (2024)
A Plug-and-Play Method for Rare Human-Object Interactions Detection by Bridging Domain Gap
di: Zhang, Lijun, et al.
Pubblicazione: (2024)
di: Zhang, Lijun, et al.
Pubblicazione: (2024)
MagicGeo: Training-Free Text-Guided Geometric Diagram Generation
di: Wang, Junxiao, et al.
Pubblicazione: (2025)
di: Wang, Junxiao, et al.
Pubblicazione: (2025)
Improving Generalized Visual Grounding with Instance-aware Joint Learning
di: Dai, Ming, et al.
Pubblicazione: (2025)
di: Dai, Ming, et al.
Pubblicazione: (2025)
Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers
di: Ma, Ji, et al.
Pubblicazione: (2025)
di: Ma, Ji, et al.
Pubblicazione: (2025)
Understanding and Mitigating Hallucinations in Multimodal Chain-of-Thought Models
di: Ma, Ji, et al.
Pubblicazione: (2026)
di: Ma, Ji, et al.
Pubblicazione: (2026)
OneActor: Consistent Character Generation via Cluster-Conditioned Guidance
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
di: Wang, Jiahao, et al.
Pubblicazione: (2024)
Multi-Task Label Discovery via Hierarchical Task Tokens for Partially Annotated Dense Predictions
di: Zhang, Jingdong, et al.
Pubblicazione: (2024)
di: Zhang, Jingdong, et al.
Pubblicazione: (2024)
Visual Object Tracking across Diverse Data Modalities: A Review
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
di: Wang, Mengmeng, et al.
Pubblicazione: (2024)
Meta-Exploiting Frequency Prior for Cross-Domain Few-Shot Learning
di: Zhou, Fei, et al.
Pubblicazione: (2024)
di: Zhou, Fei, et al.
Pubblicazione: (2024)
Pyramidal Patchification Flow for Visual Generation
di: Li, Hui, et al.
Pubblicazione: (2025)
di: Li, Hui, et al.
Pubblicazione: (2025)
RefAlign: Representation Alignment for Reference-to-Video Generation
di: Wang, Lei, et al.
Pubblicazione: (2026)
di: Wang, Lei, et al.
Pubblicazione: (2026)
HDCompression: Hybrid-Diffusion Image Compression for Ultra-Low Bitrates
di: Lu, Lei, et al.
Pubblicazione: (2025)
di: Lu, Lei, et al.
Pubblicazione: (2025)
Learning to Generalize without Bias for Open-Vocabulary Action Recognition
di: Yu, Yating, et al.
Pubblicazione: (2025)
di: Yu, Yating, et al.
Pubblicazione: (2025)
PSDiff: Diffusion Model for Person Search with Iterative and Collaborative Refinement
di: Jia, Chengyou, et al.
Pubblicazione: (2023)
di: Jia, Chengyou, et al.
Pubblicazione: (2023)
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
di: Zhang, Guosheng, et al.
Pubblicazione: (2025)
di: Zhang, Guosheng, et al.
Pubblicazione: (2025)
On Inductive Biases That Enable Generalization of Diffusion Transformers
di: An, Jie, et al.
Pubblicazione: (2024)
di: An, Jie, et al.
Pubblicazione: (2024)
SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation
di: Dou, Weijia, et al.
Pubblicazione: (2026)
di: Dou, Weijia, et al.
Pubblicazione: (2026)
GP-NeRF: Generalized Perception NeRF for Context-Aware 3D Scene Understanding
di: Li, Hao, et al.
Pubblicazione: (2023)
di: Li, Hao, et al.
Pubblicazione: (2023)
VideoVerse: Does Your T2V Generator Have World Model Capability to Synthesize Videos?
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
di: Wang, Zeqing, et al.
Pubblicazione: (2025)
Rethinking Vector Field Learning for Generative Segmentation
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
di: Wang, Chaoyang, et al.
Pubblicazione: (2026)
Generating Content for HDR Deghosting from Frequency View
di: Hu, Tao, et al.
Pubblicazione: (2024)
di: Hu, Tao, et al.
Pubblicazione: (2024)
Documenti analoghi
-
No Other Representation Component Is Needed: Diffusion Transformers Can Provide Representation Guidance by Themselves
di: Jiang, Dengyang, et al.
Pubblicazione: (2025) -
JoDiffusion: Jointly Diffusing Image with Pixel-Level Annotations for Semantic Segmentation Promotion
di: Wang, Haoyu, et al.
Pubblicazione: (2025) -
Exploring Time Conditioning in Diffusion Generative Models from Disjoint Noisy Data Manifolds
di: Li, Liuzhuozheng, et al.
Pubblicazione: (2026) -
AffordanceSAM: Segment Anything Once More in Affordance Grounding
di: Jiang, Dengyang, et al.
Pubblicazione: (2025) -
Deforming Videos to Masks: Flow Matching for Referring Video Segmentation
di: Wang, Zanyi, et al.
Pubblicazione: (2025)