Guardado en:
| Autores principales: | Sun, Qi, Zhou, Dingju, Zhang, Lina |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2511.05263 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CharDiff-LP: A Diffusion Model with Character-Level Guidance for License Plate Image Restoration
por: Na, Kihyun, et al.
Publicado: (2025)
por: Na, Kihyun, et al.
Publicado: (2025)
Learning to Align: Addressing Character Frequency Distribution Shifts in Handwritten Text Recognition
por: Kaliosis, Panagiotis, et al.
Publicado: (2025)
por: Kaliosis, Panagiotis, et al.
Publicado: (2025)
EGGS: Exchangeable 2D/3D Gaussian Splatting for Geometry-Appearance Balanced Novel View Synthesis
por: Zhang, Yancheng, et al.
Publicado: (2025)
por: Zhang, Yancheng, et al.
Publicado: (2025)
Nepali Sign Language Characters Recognition: Dataset Development and Deep Learning Approaches
por: Poudel, Birat, et al.
Publicado: (2025)
por: Poudel, Birat, et al.
Publicado: (2025)
Evaluating Dataset Watermarking for Fine-tuning Traceability of Customized Diffusion Models: A Comprehensive Benchmark and Removal Approach
por: Wang, Xincheng, et al.
Publicado: (2025)
por: Wang, Xincheng, et al.
Publicado: (2025)
PsOCR: Benchmarking Large Multimodal Models for Optical Character Recognition in Low-resource Pashto Language
por: Haq, Ijazul, et al.
Publicado: (2025)
por: Haq, Ijazul, et al.
Publicado: (2025)
A Computer Vision Pipeline for Individual-Level Behavior Analysis: Benchmarking on the Edinburgh Pig Dataset
por: Yang, Haiyu, et al.
Publicado: (2025)
por: Yang, Haiyu, et al.
Publicado: (2025)
Character-Adapter: Prompt-Guided Region Control for High-Fidelity Character Customization
por: Ma, Yuhang, et al.
Publicado: (2024)
por: Ma, Yuhang, et al.
Publicado: (2024)
My Body My Choice: Human-Centric Full-Body Anonymization
por: Ciftci, Umur Aybars, et al.
Publicado: (2024)
por: Ciftci, Umur Aybars, et al.
Publicado: (2024)
Zero-shot High-fidelity and Pose-controllable Character Animation
por: Zhu, Bingwen, et al.
Publicado: (2024)
por: Zhu, Bingwen, et al.
Publicado: (2024)
January Food Benchmark (JFB): A Public Benchmark Dataset and Evaluation Suite for Multimodal Food Analysis
por: Hosseinian, Amir, et al.
Publicado: (2025)
por: Hosseinian, Amir, et al.
Publicado: (2025)
ClimateIQA: A New Dataset and Benchmark to Advance Vision-Language Models in Meteorology Anomalies Analysis
por: Chen, Jian, et al.
Publicado: (2024)
por: Chen, Jian, et al.
Publicado: (2024)
PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos
por: Zhou, Zhiyu, et al.
Publicado: (2026)
por: Zhou, Zhiyu, et al.
Publicado: (2026)
Beyond Visual Appearances: Privacy-sensitive Objects Identification via Hybrid Graph Reasoning
por: Jiang, Zhuohang, et al.
Publicado: (2024)
por: Jiang, Zhuohang, et al.
Publicado: (2024)
Animate Any Character in Any World
por: Wang, Yitong, et al.
Publicado: (2025)
por: Wang, Yitong, et al.
Publicado: (2025)
OneActor: Consistent Character Generation via Cluster-Conditioned Guidance
por: Wang, Jiahao, et al.
Publicado: (2024)
por: Wang, Jiahao, et al.
Publicado: (2024)
TowerDataset: A Heterogeneous Benchmark for Transmission Corridor Segmentation with a Global-Local Fusion Framework
por: Cui, Xu, et al.
Publicado: (2026)
por: Cui, Xu, et al.
Publicado: (2026)
2K-Characters-10K-Stories: A Quality-Gated Stylized Narrative Dataset with Disentangled Control and Sequence Consistency
por: Yin, Xingxi, et al.
Publicado: (2025)
por: Yin, Xingxi, et al.
Publicado: (2025)
UniLat3D: Geometry-Appearance Unified Latents for Single-Stage 3D Generation
por: Wu, Guanjun, et al.
Publicado: (2025)
por: Wu, Guanjun, et al.
Publicado: (2025)
LOCR: Location-Guided Transformer for Optical Character Recognition
por: Sun, Yu, et al.
Publicado: (2024)
por: Sun, Yu, et al.
Publicado: (2024)
STAR: A First-Ever Dataset and A Large-Scale Benchmark for Scene Graph Generation in Large-Size Satellite Imagery
por: Li, Yansheng, et al.
Publicado: (2024)
por: Li, Yansheng, et al.
Publicado: (2024)
OODFace: Benchmarking Robustness of Face Recognition under Common Corruptions and Appearance Variations
por: Kang, Caixin, et al.
Publicado: (2024)
por: Kang, Caixin, et al.
Publicado: (2024)
COMIC: Agentic Sketch Comedy Generation
por: Hong, Susung, et al.
Publicado: (2026)
por: Hong, Susung, et al.
Publicado: (2026)
Hierarchical Concept-to-Appearance Guidance for Multi-Subject Image Generation
por: Xu, Yijia, et al.
Publicado: (2026)
por: Xu, Yijia, et al.
Publicado: (2026)
HanDiffuser: Text-to-Image Generation With Realistic Hand Appearances
por: Narasimhaswamy, Supreeth, et al.
Publicado: (2024)
por: Narasimhaswamy, Supreeth, et al.
Publicado: (2024)
Eye-for-an-eye: Appearance Transfer with Semantic Correspondence in Diffusion Models
por: Go, Sooyeon, et al.
Publicado: (2024)
por: Go, Sooyeon, et al.
Publicado: (2024)
Gastric-X: A Multimodal Multi-Phase Benchmark Dataset for Advancing Vision-Language Models in Gastric Cancer Analysis
por: Lu, Sheng, et al.
Publicado: (2026)
por: Lu, Sheng, et al.
Publicado: (2026)
Unified and Dynamic Graph for Temporal Character Grouping in Long Videos
por: Shu, Xiujun, et al.
Publicado: (2023)
por: Shu, Xiujun, et al.
Publicado: (2023)
Multi-Modal Character Localization and Extraction for Chinese Text Recognition
por: Li, Qilong, et al.
Publicado: (2026)
por: Li, Qilong, et al.
Publicado: (2026)
AllClear: A Comprehensive Dataset and Benchmark for Cloud Removal in Satellite Imagery
por: Zhou, Hangyu, et al.
Publicado: (2024)
por: Zhou, Hangyu, et al.
Publicado: (2024)
LocRef-Diffusion:Tuning-Free Layout and Appearance-Guided Generation
por: Deng, Fan, et al.
Publicado: (2024)
por: Deng, Fan, et al.
Publicado: (2024)
MOT FCG++: Enhanced Representation of Spatio-temporal Motion and Appearance Features
por: Fang, Yanzhao
Publicado: (2024)
por: Fang, Yanzhao
Publicado: (2024)
GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding
por: Chen, Dongping, et al.
Publicado: (2024)
por: Chen, Dongping, et al.
Publicado: (2024)
CGFformer: Cluster-Guidance Frequency Transformer for Pansharpening
por: Zhou, Zijian, et al.
Publicado: (2026)
por: Zhou, Zijian, et al.
Publicado: (2026)
PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement
por: Zhan, Yu-Wei, et al.
Publicado: (2025)
por: Zhan, Yu-Wei, et al.
Publicado: (2025)
SteelDefectX: A Multi-Form Vision-Language Dataset and Benchmark for Steel Surface Defect Analysis
por: Zhao, Shuxian, et al.
Publicado: (2026)
por: Zhao, Shuxian, et al.
Publicado: (2026)
DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation
por: Ma, Zehong, et al.
Publicado: (2025)
por: Ma, Zehong, et al.
Publicado: (2025)
Exploring Cross-Domain Few-Shot Classification via Frequency-Aware Prompting
por: Zhang, Tiange, et al.
Publicado: (2024)
por: Zhang, Tiange, et al.
Publicado: (2024)
AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse Guidance
por: Wang, Zhao, et al.
Publicado: (2025)
por: Wang, Zhao, et al.
Publicado: (2025)
Deep Learning in Dental Image Analysis: A Systematic Review of Datasets, Methodologies, and Emerging Challenges
por: Zhou, Zhenhuan, et al.
Publicado: (2025)
por: Zhou, Zhenhuan, et al.
Publicado: (2025)
Ejemplares similares
-
CharDiff-LP: A Diffusion Model with Character-Level Guidance for License Plate Image Restoration
por: Na, Kihyun, et al.
Publicado: (2025) -
Learning to Align: Addressing Character Frequency Distribution Shifts in Handwritten Text Recognition
por: Kaliosis, Panagiotis, et al.
Publicado: (2025) -
EGGS: Exchangeable 2D/3D Gaussian Splatting for Geometry-Appearance Balanced Novel View Synthesis
por: Zhang, Yancheng, et al.
Publicado: (2025) -
Nepali Sign Language Characters Recognition: Dataset Development and Deep Learning Approaches
por: Poudel, Birat, et al.
Publicado: (2025) -
Evaluating Dataset Watermarking for Fine-tuning Traceability of Customized Diffusion Models: A Comprehensive Benchmark and Removal Approach
por: Wang, Xincheng, et al.
Publicado: (2025)