Enregistré dans:
| Auteurs principaux: | Zhang, Ruiqiang, Wang, Hengyi, Liu, Chang, Wang, Guanjie, Ma, Zehua, Zhang, Weiming |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2601.00535 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Allocentric Perceiver: Disentangling Allocentric Reasoning from Egocentric Visual Priors via Frame Instantiation
par: Wang, Hengyi, et autres
Publié: (2026)
par: Wang, Hengyi, et autres
Publié: (2026)
Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending
par: Hou, Jingqi, et autres
Publié: (2026)
par: Hou, Jingqi, et autres
Publié: (2026)
AuthSig: Safeguarding Scanned Signatures Against Unauthorized Reuse in Paperless Workflows
par: Zhang, RuiQiang, et autres
Publié: (2025)
par: Zhang, RuiQiang, et autres
Publié: (2025)
Flow of Truth: Proactive Temporal Forensics for Image-to-Video Generation
par: Chen, Yuzhuo, et autres
Publié: (2026)
par: Chen, Yuzhuo, et autres
Publié: (2026)
TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment
par: Baek, Kanghyun, et autres
Publié: (2025)
par: Baek, Kanghyun, et autres
Publié: (2025)
I2VWM: Robust Watermarking for Image to Video Generation
par: Wang, Guanjie, et autres
Publié: (2025)
par: Wang, Guanjie, et autres
Publié: (2025)
GlyphBanana: Advancing Precise Text Rendering Through Agentic Workflows
par: Yan, Zexuan, et autres
Publié: (2026)
par: Yan, Zexuan, et autres
Publié: (2026)
GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering
par: Shuai, Xincheng, et autres
Publié: (2026)
par: Shuai, Xincheng, et autres
Publié: (2026)
EasyText: Controllable Diffusion Transformer for Multilingual Text Rendering
par: Lu, Runnan, et autres
Publié: (2025)
par: Lu, Runnan, et autres
Publié: (2025)
Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering
par: Liu, Zeyu, et autres
Publié: (2024)
par: Liu, Zeyu, et autres
Publié: (2024)
HDGlyph: A Hierarchical Disentangled Glyph-Based Framework for Long-Tail Text Rendering in Diffusion Models
par: Zhuang, Shuhan, et autres
Publié: (2025)
par: Zhuang, Shuhan, et autres
Publié: (2025)
Refining Text-to-Image Generation: Towards Accurate Training-Free Glyph-Enhanced Image Generation
par: Lakhanpal, Sanyam, et autres
Publié: (2024)
par: Lakhanpal, Sanyam, et autres
Publié: (2024)
LAMIC: Layout-Aware Multi-Image Composition via Scalability of Multimodal Diffusion Transformer
par: Chen, Yuzhuo, et autres
Publié: (2025)
par: Chen, Yuzhuo, et autres
Publié: (2025)
GlyphMastero: A Glyph Encoder for High-Fidelity Scene Text Editing
par: Wang, Tong, et autres
Publié: (2025)
par: Wang, Tong, et autres
Publié: (2025)
CountDiffusion: Text-to-Image Synthesis with Training-Free Counting-Guidance Diffusion
par: Li, Yanyu, et autres
Publié: (2025)
par: Li, Yanyu, et autres
Publié: (2025)
SKeDA: A Generative Watermarking Framework for Text-to-video Diffusion Models
par: Yang, Yang, et autres
Publié: (2026)
par: Yang, Yang, et autres
Publié: (2026)
Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer
par: Yin, Zixin, et autres
Publié: (2025)
par: Yin, Zixin, et autres
Publié: (2025)
EchoPilot: Training-Free Ultrasound Video Segmentation via Scale-Space Semantic Prompting and Reliability-Gated Memory
par: Xiao, Ruiqiang, et autres
Publié: (2026)
par: Xiao, Ruiqiang, et autres
Publié: (2026)
TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models
par: Xiang, Qianlong, et autres
Publié: (2026)
par: Xiang, Qianlong, et autres
Publié: (2026)
RepText: Rendering Visual Text via Replicating
par: Wang, Haofan, et autres
Publié: (2025)
par: Wang, Haofan, et autres
Publié: (2025)
TextMaster: A Unified Framework for Realistic Text Editing via Glyph-Style Dual-Control
par: Yan, Zhenyu, et autres
Publié: (2024)
par: Yan, Zhenyu, et autres
Publié: (2024)
Glyph-ByT5-v2: A Strong Aesthetic Baseline for Accurate Multilingual Visual Text Rendering
par: Liu, Zeyu, et autres
Publié: (2024)
par: Liu, Zeyu, et autres
Publié: (2024)
Decoupling Training-Free Guided Diffusion by ADMM
par: Zhang, Youyuan, et autres
Publié: (2024)
par: Zhang, Youyuan, et autres
Publié: (2024)
DanceText: A Training-Free Layered Framework for Controllable Multilingual Text Transformation in Images
par: Yu, Zhenyu, et autres
Publié: (2025)
par: Yu, Zhenyu, et autres
Publié: (2025)
DiffInk: Glyph- and Style-Aware Latent Diffusion Transformer for Text to Online Handwriting Generation
par: Pan, Wei, et autres
Publié: (2025)
par: Pan, Wei, et autres
Publié: (2025)
Detail++: Training-Free Detail Enhancer for Text-to-Image Diffusion Models
par: Chen, Lifeng, et autres
Publié: (2025)
par: Chen, Lifeng, et autres
Publié: (2025)
UniGlyph: Unified Segmentation-Conditioned Diffusion for Precise Visual Text Synthesis
par: Wang, Yuanrui, et autres
Publié: (2025)
par: Wang, Yuanrui, et autres
Publié: (2025)
Towards Training-Free Scene Text Editing
par: Li, Yubo, et autres
Publié: (2026)
par: Li, Yubo, et autres
Publié: (2026)
Glyph: Scaling Context Windows via Visual-Text Compression
par: Cheng, Jiale, et autres
Publié: (2025)
par: Cheng, Jiale, et autres
Publié: (2025)
MagicGeo: Training-Free Text-Guided Geometric Diagram Generation
par: Wang, Junxiao, et autres
Publié: (2025)
par: Wang, Junxiao, et autres
Publié: (2025)
TextPixs: Glyph-Conditioned Diffusion with Character-Aware Attention and OCR-Guided Supervision
par: Gillani, Syeda Anshrah, et autres
Publié: (2025)
par: Gillani, Syeda Anshrah, et autres
Publié: (2025)
RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation
par: Pang, Lexi, et autres
Publié: (2025)
par: Pang, Lexi, et autres
Publié: (2025)
E-SAM: Training-Free Segment Every Entity Model
par: Zhang, Weiming, et autres
Publié: (2025)
par: Zhang, Weiming, et autres
Publié: (2025)
CoDA: From Text-to-Image Diffusion Models to Training-Free Dataset Distillation
par: Zhou, Letian, et autres
Publié: (2025)
par: Zhou, Letian, et autres
Publié: (2025)
UniCtrl: Improving the Spatiotemporal Consistency of Text-to-Video Diffusion Models via Training-Free Unified Attention Control
par: Xia, Tian, et autres
Publié: (2024)
par: Xia, Tian, et autres
Publié: (2024)
LOGO: Video Text Spotting with Language Collaboration and Glyph Perception Model
par: Liu, Hongen, et autres
Publié: (2024)
par: Liu, Hongen, et autres
Publié: (2024)
AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation
par: Liu, Yexin, et autres
Publié: (2025)
par: Liu, Yexin, et autres
Publié: (2025)
FlexID: Training-Free Flexible Identity Injection via Intent-Aware Modulation for Text-to-Image Generation
par: Li, Guandong, et autres
Publié: (2026)
par: Li, Guandong, et autres
Publié: (2026)
Attention Frequency Modulation: Training-Free Spectral Modulation of Diffusion Cross-Attention
par: Oh, Seunghun, et autres
Publié: (2026)
par: Oh, Seunghun, et autres
Publié: (2026)
From Text to Mask: Localizing Entities Using the Attention of Text-to-Image Diffusion Models
par: Xiao, Changming, et autres
Publié: (2023)
par: Xiao, Changming, et autres
Publié: (2023)
Documents similaires
-
Allocentric Perceiver: Disentangling Allocentric Reasoning from Egocentric Visual Priors via Frame Instantiation
par: Wang, Hengyi, et autres
Publié: (2026) -
Training-Free Occluded Text Rendering via Glyph Priors and Attention-Guided Semantic Blending
par: Hou, Jingqi, et autres
Publié: (2026) -
AuthSig: Safeguarding Scanned Signatures Against Unauthorized Reuse in Paperless Workflows
par: Zhang, RuiQiang, et autres
Publié: (2025) -
Flow of Truth: Proactive Temporal Forensics for Image-to-Video Generation
par: Chen, Yuzhuo, et autres
Publié: (2026) -
TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment
par: Baek, Kanghyun, et autres
Publié: (2025)