Add-SD: Rational Generation without Manual Reference
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Lingfeng, Zhang, Xinyu, Li, Xiang, Chen, Jinwen, Yao, Kun, Zhang, Gang, Ding, Errui, Liu, Lingqiao, Wang, Jingdong, Yang, Jian |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
VRP-SAM: SAM with Visual Reference Prompt
por: Sun, Yanpeng, et al.
Publicado: (2024)
por: Sun, Yanpeng, et al.
Publicado: (2024)
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
por: Zhang, Guosheng, et al.
Publicado: (2025)
por: Zhang, Guosheng, et al.
Publicado: (2025)
OVLW-DETR: Open-Vocabulary Light-Weighted Detection Transformer
por: Wang, Yu, et al.
Publicado: (2024)
por: Wang, Yu, et al.
Publicado: (2024)
FullAnno: A Data Engine for Enhancing Image Comprehension of MLLMs
por: Hao, Jing, et al.
Publicado: (2024)
por: Hao, Jing, et al.
Publicado: (2024)
TopoSD: Topology-Enhanced Lane Segment Perception with SDMap Prior
por: Yang, Sen, et al.
Publicado: (2024)
por: Yang, Sen, et al.
Publicado: (2024)
LW-DETR: A Transformer Replacement to YOLO for Real-Time Detection
por: Chen, Qiang, et al.
Publicado: (2024)
por: Chen, Qiang, et al.
Publicado: (2024)
MS-DETR: Efficient DETR Training with Mixed Supervision
por: Zhao, Chuyang, et al.
Publicado: (2024)
por: Zhao, Chuyang, et al.
Publicado: (2024)
Towards Unified Multi-granularity Text Detection with Interactive Attention
por: Wan, Xingyu, et al.
Publicado: (2024)
por: Wan, Xingyu, et al.
Publicado: (2024)
Training-Free Motion-Guided Video Generation with Enhanced Temporal Consistency Using Motion Consistency Loss
por: Zhang, Xinyu, et al.
Publicado: (2025)
por: Zhang, Xinyu, et al.
Publicado: (2025)
MGMapNet: Multi-Granularity Representation Learning for End-to-End Vectorized HD Map Construction
por: Yang, Jing, et al.
Publicado: (2024)
por: Yang, Jing, et al.
Publicado: (2024)
Skim then Focus: Integrating Contextual and Fine-grained Views for Repetitive Action Counting
por: Zhao, Zhengqi, et al.
Publicado: (2024)
por: Zhao, Zhengqi, et al.
Publicado: (2024)
StrucTexTv3: An Efficient Vision-Language Model for Text-rich Image Perception, Comprehension, and Beyond
por: Lyu, Pengyuan, et al.
Publicado: (2024)
por: Lyu, Pengyuan, et al.
Publicado: (2024)
CM-MaskSD: Cross-Modality Masked Self-Distillation for Referring Image Segmentation
por: Wang, Wenxuan, et al.
Publicado: (2023)
por: Wang, Wenxuan, et al.
Publicado: (2023)
GIR: 3D Gaussian Inverse Rendering for Relightable Scene Factorization
por: Shi, Yahao, et al.
Publicado: (2023)
por: Shi, Yahao, et al.
Publicado: (2023)
LaMI-DETR: Open-Vocabulary Detection with Language Model Instruction
por: Du, Penghui, et al.
Publicado: (2024)
por: Du, Penghui, et al.
Publicado: (2024)
Decoupled Pseudo-labeling for Semi-Supervised Monocular 3D Object Detection
por: Zhang, Jiacheng, et al.
Publicado: (2024)
por: Zhang, Jiacheng, et al.
Publicado: (2024)
Improving Generalized Visual Grounding with Instance-aware Joint Learning
por: Dai, Ming, et al.
Publicado: (2025)
por: Dai, Ming, et al.
Publicado: (2025)
XLD: A Cross-Lane Dataset for Benchmarking Novel Driving View Synthesis
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
Revisiting Vision Language Foundations for No-Reference Image Quality Assessment
por: Yadav, Ankit, et al.
Publicado: (2025)
por: Yadav, Ankit, et al.
Publicado: (2025)
ALoRE: Efficient Visual Adaptation via Aggregating Low Rank Experts
por: Du, Sinan, et al.
Publicado: (2024)
por: Du, Sinan, et al.
Publicado: (2024)
Explanatory Instructions: Towards Unified Vision Tasks Understanding and Zero-shot Generalization
por: Shen, Yang, et al.
Publicado: (2024)
por: Shen, Yang, et al.
Publicado: (2024)
OPEN: Object-wise Position Embedding for Multi-view 3D Object Detection
por: Hou, Jinghua, et al.
Publicado: (2024)
por: Hou, Jinghua, et al.
Publicado: (2024)
Re-HOLD: Video Hand Object Interaction Reenactment via adaptive Layout-instructed Diffusion Model
por: Fan, Yingying, et al.
Publicado: (2025)
por: Fan, Yingying, et al.
Publicado: (2025)
TexRO: Generating Delicate Textures of 3D Models by Recursive Optimization
por: Wu, Jinbo, et al.
Publicado: (2024)
por: Wu, Jinbo, et al.
Publicado: (2024)
SD-NAE: Generating Natural Adversarial Examples with Stable Diffusion
por: Lin, Yueqian, et al.
Publicado: (2023)
por: Lin, Yueqian, et al.
Publicado: (2023)
A Causal Inspired Early-Branching Structure for Domain Generalization
por: Chen, Liang, et al.
Publicado: (2024)
por: Chen, Liang, et al.
Publicado: (2024)
Gradient-based Sampling for Class Imbalanced Semi-supervised Object Detection
por: Li, Jiaming, et al.
Publicado: (2024)
por: Li, Jiaming, et al.
Publicado: (2024)
GGRt: Towards Pose-free Generalizable 3D Gaussian Splatting in Real-time
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
VDG: Vision-Only Dynamic Gaussian for Driving Simulation
por: Li, Hao, et al.
Publicado: (2024)
por: Li, Hao, et al.
Publicado: (2024)
Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning
por: Xu, Hai-Ming, et al.
Publicado: (2024)
por: Xu, Hai-Ming, et al.
Publicado: (2024)
Agent-based Video Trimming
por: Yang, Lingfeng, et al.
Publicado: (2024)
por: Yang, Lingfeng, et al.
Publicado: (2024)
MonoFormer: One Transformer for Both Diffusion and Autoregression
por: Zhao, Chuyang, et al.
Publicado: (2024)
por: Zhao, Chuyang, et al.
Publicado: (2024)
OpenGaussian: Towards Point-Level 3D Gaussian-based Open Vocabulary Understanding
por: Wu, Yanmin, et al.
Publicado: (2024)
por: Wu, Yanmin, et al.
Publicado: (2024)
AddSR: Accelerating Diffusion-based Blind Super-Resolution with Adversarial Diffusion Distillation
por: Xie, Rui, et al.
Publicado: (2024)
por: Xie, Rui, et al.
Publicado: (2024)
Get In Video: Add Anything You Want to the Video
por: Zhuang, Shaobin, et al.
Publicado: (2025)
por: Zhuang, Shaobin, et al.
Publicado: (2025)
CODER: Coupled Diversity-Sensitive Momentum Contrastive Learning for Image-Text Retrieval
por: Wang, Haoran, et al.
Publicado: (2022)
por: Wang, Haoran, et al.
Publicado: (2022)
GVA: Reconstructing Vivid 3D Gaussian Avatars from Monocular Videos
por: Liu, Xinqi, et al.
Publicado: (2024)
por: Liu, Xinqi, et al.
Publicado: (2024)
RefAlign: Representation Alignment for Reference-to-Video Generation
por: Wang, Lei, et al.
Publicado: (2026)
por: Wang, Lei, et al.
Publicado: (2026)
The CLIP Model is Secretly an Image-to-Prompt Converter
por: Ding, Yuxuan, et al.
Publicado: (2023)
por: Ding, Yuxuan, et al.
Publicado: (2023)
Continuous Speculative Decoding for Autoregressive Image Generation
por: Wang, Zili, et al.
Publicado: (2024)
por: Wang, Zili, et al.
Publicado: (2024)
Ejemplares similares
-
VRP-SAM: SAM with Visual Reference Prompt
por: Sun, Yanpeng, et al.
Publicado: (2024) -
Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models
por: Zhang, Guosheng, et al.
Publicado: (2025) -
OVLW-DETR: Open-Vocabulary Light-Weighted Detection Transformer
por: Wang, Yu, et al.
Publicado: (2024) -
FullAnno: A Data Engine for Enhancing Image Comprehension of MLLMs
por: Hao, Jing, et al.
Publicado: (2024) -
TopoSD: Topology-Enhanced Lane Segment Perception with SDMap Prior
por: Yang, Sen, et al.
Publicado: (2024)