What Shape Is Optimal for Masks in Text Removal?
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nakada, Hyakka, Kubota, Marika |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Robustness of Structured Data Extraction from Perspectively Distorted Documents
par: Nakada, Hyakka, et autres
Publié: (2025)
par: Nakada, Hyakka, et autres
Publié: (2025)
Centered Masking for Language-Image Pre-Training
par: Liang, Mingliang, et autres
Publié: (2024)
par: Liang, Mingliang, et autres
Publié: (2024)
BodyShapeGPT: SMPL Body Shape Manipulation with LLMs
par: Árbol, Baldomero R., et autres
Publié: (2024)
par: Árbol, Baldomero R., et autres
Publié: (2024)
Model Interpretability and Rationale Extraction by Input Mask Optimization
par: Brinner, Marc, et autres
Publié: (2025)
par: Brinner, Marc, et autres
Publié: (2025)
FisherMask: Enhancing Neural Network Labeling Efficiency in Image Classification Using Fisher Information
par: Gul, Shreen, et autres
Publié: (2024)
par: Gul, Shreen, et autres
Publié: (2024)
Mostly Text, Smart Visuals: Asymmetric Text-Visual Pruning for Large Vision-Language Models
par: Li, Sijie, et autres
Publié: (2026)
par: Li, Sijie, et autres
Publié: (2026)
Text-centric Alignment for Multi-Modality Learning
par: Tsai, Yun-Da, et autres
Publié: (2024)
par: Tsai, Yun-Da, et autres
Publié: (2024)
Evaluating Numerical Reasoning in Text-to-Image Models
par: Kajić, Ivana, et autres
Publié: (2024)
par: Kajić, Ivana, et autres
Publié: (2024)
Reverse Stable Diffusion: What prompt was used to generate this image?
par: Croitoru, Florinel-Alin, et autres
Publié: (2023)
par: Croitoru, Florinel-Alin, et autres
Publié: (2023)
MAGIC: Near-Optimal Data Attribution for Deep Learning
par: Ilyas, Andrew, et autres
Publié: (2025)
par: Ilyas, Andrew, et autres
Publié: (2025)
HATFormer: Historic Handwritten Arabic Text Recognition with Transformers
par: Chan, Adrian, et autres
Publié: (2024)
par: Chan, Adrian, et autres
Publié: (2024)
Alt-Text with Context: Improving Accessibility for Images on Twitter
par: Srivatsan, Nikita, et autres
Publié: (2023)
par: Srivatsan, Nikita, et autres
Publié: (2023)
Efficient Scaling of Diffusion Transformers for Text-to-Image Generation
par: Li, Hao, et autres
Publié: (2024)
par: Li, Hao, et autres
Publié: (2024)
Lumos : Empowering Multimodal LLMs with Scene Text Recognition
par: Shenoy, Ashish, et autres
Publié: (2024)
par: Shenoy, Ashish, et autres
Publié: (2024)
Highlighting What Matters: Promptable Embeddings for Attribute-Focused Image Retrieval
par: Li, Siting, et autres
Publié: (2025)
par: Li, Siting, et autres
Publié: (2025)
VPO: Aligning Text-to-Video Generation Models with Prompt Optimization
par: Cheng, Jiale, et autres
Publié: (2025)
par: Cheng, Jiale, et autres
Publié: (2025)
BiasConnect: Investigating Bias Interactions in Text-to-Image Models
par: Shukla, Pushkar, et autres
Publié: (2025)
par: Shukla, Pushkar, et autres
Publié: (2025)
Glyph: Scaling Context Windows via Visual-Text Compression
par: Cheng, Jiale, et autres
Publié: (2025)
par: Cheng, Jiale, et autres
Publié: (2025)
T-MARS: Improving Visual Representations by Circumventing Text Feature Learning
par: Maini, Pratyush, et autres
Publié: (2023)
par: Maini, Pratyush, et autres
Publié: (2023)
Text-to-Image Cross-Modal Generation: A Systematic Review
par: Żelaszczyk, Maciej, et autres
Publié: (2024)
par: Żelaszczyk, Maciej, et autres
Publié: (2024)
Semantic Token Reweighting for Interpretable and Controllable Text Embeddings in CLIP
par: Kim, Eunji, et autres
Publié: (2024)
par: Kim, Eunji, et autres
Publié: (2024)
BAD: Bidirectional Auto-regressive Diffusion for Text-to-Motion Generation
par: Hosseyni, S. Rohollah, et autres
Publié: (2024)
par: Hosseyni, S. Rohollah, et autres
Publié: (2024)
Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation
par: Yin, Shukang, et autres
Publié: (2024)
par: Yin, Shukang, et autres
Publié: (2024)
Advanced Multimodal Deep Learning Architecture for Image-Text Matching
par: Wang, Jinyin, et autres
Publié: (2024)
par: Wang, Jinyin, et autres
Publié: (2024)
Text Role Classification in Scientific Charts Using Multimodal Transformers
par: Kim, Hye Jin, et autres
Publié: (2024)
par: Kim, Hye Jin, et autres
Publié: (2024)
DreamReward: Text-to-3D Generation with Human Preference
par: Ye, Junliang, et autres
Publié: (2024)
par: Ye, Junliang, et autres
Publié: (2024)
Whats in a Video: Factorized Autoregressive Decoding for Online Dense Video Captioning
par: Piergiovanni, AJ, et autres
Publié: (2024)
par: Piergiovanni, AJ, et autres
Publié: (2024)
EVEREST: Efficient Masked Video Autoencoder by Removing Redundant Spatiotemporal Tokens
par: Hwang, Sunil, et autres
Publié: (2022)
par: Hwang, Sunil, et autres
Publié: (2022)
FairImagen: Post-Processing for Bias Mitigation in Text-to-Image Models
par: Fu, Zihao, et autres
Publié: (2025)
par: Fu, Zihao, et autres
Publié: (2025)
Text-Enhanced Data-free Approach for Federated Class-Incremental Learning
par: Tran, Minh-Tuan, et autres
Publié: (2024)
par: Tran, Minh-Tuan, et autres
Publié: (2024)
T$^3$Bench: Benchmarking Current Progress in Text-to-3D Generation
par: He, Yuze, et autres
Publié: (2023)
par: He, Yuze, et autres
Publié: (2023)
Quilt-1M: One Million Image-Text Pairs for Histopathology
par: Ikezogwo, Wisdom Oluchi, et autres
Publié: (2023)
par: Ikezogwo, Wisdom Oluchi, et autres
Publié: (2023)
MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image
par: Arazi, Alan, et autres
Publié: (2026)
par: Arazi, Alan, et autres
Publié: (2026)
What If the TV Was Off? Examining Counterfactual Reasoning Abilities of Multi-modal Language Models
par: Zhang, Letian, et autres
Publié: (2023)
par: Zhang, Letian, et autres
Publié: (2023)
A Framework For Refining Text Classification and Object Recognition from Academic Articles
par: Li, Jinghong, et autres
Publié: (2023)
par: Li, Jinghong, et autres
Publié: (2023)
MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks
par: Wu, Yiming, et autres
Publié: (2024)
par: Wu, Yiming, et autres
Publié: (2024)
PromptTA: Prompt-driven Text Adapter for Source-free Domain Generalization
par: Zhang, Haoran, et autres
Publié: (2024)
par: Zhang, Haoran, et autres
Publié: (2024)
BiVLC: Extending Vision-Language Compositionality Evaluation with Text-to-Image Retrieval
par: Miranda, Imanol, et autres
Publié: (2024)
par: Miranda, Imanol, et autres
Publié: (2024)
Ethical-Lens: Curbing Malicious Usages of Open-Source Text-to-Image Models
par: Cai, Yuzhu, et autres
Publié: (2024)
par: Cai, Yuzhu, et autres
Publié: (2024)
ConceptBed: Evaluating Concept Learning Abilities of Text-to-Image Diffusion Models
par: Patel, Maitreya, et autres
Publié: (2023)
par: Patel, Maitreya, et autres
Publié: (2023)
Documents similaires
-
Robustness of Structured Data Extraction from Perspectively Distorted Documents
par: Nakada, Hyakka, et autres
Publié: (2025) -
Centered Masking for Language-Image Pre-Training
par: Liang, Mingliang, et autres
Publié: (2024) -
BodyShapeGPT: SMPL Body Shape Manipulation with LLMs
par: Árbol, Baldomero R., et autres
Publié: (2024) -
Model Interpretability and Rationale Extraction by Input Mask Optimization
par: Brinner, Marc, et autres
Publié: (2025) -
FisherMask: Enhancing Neural Network Labeling Efficiency in Image Classification Using Fisher Information
par: Gul, Shreen, et autres
Publié: (2024)