Guardado en:
| Autores principales: | Taniguchi, Takara, Shimoda, Wataru, Yamaguchi, Kota, Nakayama, Hideki |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2509.24331 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Learning Gaussian Data Augmentation in Feature Space for One-shot Object Detection in Manga
por: Taniguchi, Takara, et al.
Publicado: (2024)
por: Taniguchi, Takara, et al.
Publicado: (2024)
EDGE-Shield: Efficient Denoising-staGE Shield for Violative Content Filtering via Scalable Reference-Based Matching
por: Taniguchi, Takara, et al.
Publicado: (2026)
por: Taniguchi, Takara, et al.
Publicado: (2026)
MangaUB: A Manga Understanding Benchmark for Large Multimodal Models
por: Ikuta, Hikaru, et al.
Publicado: (2024)
por: Ikuta, Hikaru, et al.
Publicado: (2024)
Harnessing the Latent Diffusion Model for Training-Free Image Style Transfer
por: Masui, Kento, et al.
Publicado: (2024)
por: Masui, Kento, et al.
Publicado: (2024)
On Parallelism in Music and Language: A Perspective from Symbol Emergence Systems based on Probabilistic Generative Models
por: Taniguchi, Tadahiro
Publicado: (2025)
por: Taniguchi, Tadahiro
Publicado: (2025)
OTR: Synthesizing Overlay Text Dataset for Text Removal
por: Zdenek, Jan, et al.
Publicado: (2025)
por: Zdenek, Jan, et al.
Publicado: (2025)
Multimodal Markup Document Models for Graphic Design Completion
por: Kikuchi, Kotaro, et al.
Publicado: (2024)
por: Kikuchi, Kotaro, et al.
Publicado: (2024)
OpenCOLE: Towards Reproducible Automatic Graphic Design Generation
por: Inoue, Naoto, et al.
Publicado: (2024)
por: Inoue, Naoto, et al.
Publicado: (2024)
FashionReGen: LLM-Empowered Fashion Report Generation
por: Ding, Yujuan, et al.
Publicado: (2024)
por: Ding, Yujuan, et al.
Publicado: (2024)
AdaptaGen: Domain-Specific Image Generation through Hierarchical Semantic Optimization Framework
por: Zhang, Suoxiang, et al.
Publicado: (2025)
por: Zhang, Suoxiang, et al.
Publicado: (2025)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
por: Hao, Bowen, et al.
Publicado: (2025)
por: Hao, Bowen, et al.
Publicado: (2025)
CAFE: Channel-Autoregressive Factorized Encoding for Robust Biosignal Spatial Super-Resolution
por: Liu, Hongjun, et al.
Publicado: (2026)
por: Liu, Hongjun, et al.
Publicado: (2026)
MindFuse: Towards GenAI Explainability in Marketing Strategy Co-Creation
por: Farseev, Aleksandr, et al.
Publicado: (2025)
por: Farseev, Aleksandr, et al.
Publicado: (2025)
A 3D Framework for Improving Low-Latency Multi-Channel Live Streaming
por: Aiersilan, Aizierjiang, et al.
Publicado: (2024)
por: Aiersilan, Aizierjiang, et al.
Publicado: (2024)
Immersive Fantasy Based on Digital Nostalgia: Environmental Narratives for the Korean Millennials and Gen Z
por: Doh, Yerin, et al.
Publicado: (2025)
por: Doh, Yerin, et al.
Publicado: (2025)
Face Consistency Benchmark for GenAI Video
por: Podstawski, Michal, et al.
Publicado: (2025)
por: Podstawski, Michal, et al.
Publicado: (2025)
Total Disentanglement of Font Images into Style and Character Class Features
por: Haraguchi, Daichi, et al.
Publicado: (2024)
por: Haraguchi, Daichi, et al.
Publicado: (2024)
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
por: Wang, Sen, et al.
Publicado: (2025)
por: Wang, Sen, et al.
Publicado: (2025)
A Low-Latency 3D Live Remote Visualization System for Tourist Sites Integrating Dynamic and Pre-captured Static Point Clouds
por: Matsumoto, Takahiro, et al.
Publicado: (2025)
por: Matsumoto, Takahiro, et al.
Publicado: (2025)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
por: Li, Minghan, et al.
Publicado: (2026)
por: Li, Minghan, et al.
Publicado: (2026)
Generative AI-enabled Mobile Tactical Multimedia Networks: Distribution, Generation, and Perception
por: Xu, Minrui, et al.
Publicado: (2024)
por: Xu, Minrui, et al.
Publicado: (2024)
Hyperbolic Multimodal Generative Representation Learning for Generalized Zero-Shot Multimodal Information Extraction
por: Zhou, Baohang, et al.
Publicado: (2026)
por: Zhou, Baohang, et al.
Publicado: (2026)
MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation
por: Wang, Muyao, et al.
Publicado: (2026)
por: Wang, Muyao, et al.
Publicado: (2026)
Editing on the Generative Manifold: A Theoretical and Empirical Study of General Diffusion-Based Image Editing Trade-offs
por: Hu, Yi, et al.
Publicado: (2026)
por: Hu, Yi, et al.
Publicado: (2026)
DeepStream: Prototyping Deep Joint Source-Channel Coding for Real-Time Multimedia Transmissions
por: Chi, Kaiyi, et al.
Publicado: (2025)
por: Chi, Kaiyi, et al.
Publicado: (2025)
PiGW: A Plug-in Generative Watermarking Framework
por: Ma, Rui, et al.
Publicado: (2024)
por: Ma, Rui, et al.
Publicado: (2024)
Cap2Sum: Learning to Summarize Videos by Generating Captions
por: Zhao, Cairong, et al.
Publicado: (2024)
por: Zhao, Cairong, et al.
Publicado: (2024)
Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing
por: Zhang, Juan, et al.
Publicado: (2024)
por: Zhang, Juan, et al.
Publicado: (2024)
Synchronized Video Storytelling: Generating Video Narrations with Structured Storyline
por: Yang, Dingyi, et al.
Publicado: (2024)
por: Yang, Dingyi, et al.
Publicado: (2024)
Multi-Reference Generative Face Video Compression with Contrastive Learning
por: Konuko, Goluck, et al.
Publicado: (2024)
por: Konuko, Goluck, et al.
Publicado: (2024)
Analyzing Recursiveness in Multimodal Generative Artificial Intelligence: Stability or Divergence?
por: Conde, Javier, et al.
Publicado: (2024)
por: Conde, Javier, et al.
Publicado: (2024)
Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
por: Tong, Haonan, et al.
Publicado: (2024)
por: Tong, Haonan, et al.
Publicado: (2024)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
por: Yang, Jianxuan, et al.
Publicado: (2025)
por: Yang, Jianxuan, et al.
Publicado: (2025)
Latent Feature-Guided Conditional Diffusion for Generative Image Semantic Communication
por: Chen, Zehao, et al.
Publicado: (2025)
por: Chen, Zehao, et al.
Publicado: (2025)
Automatically Generating High-Precision Simulated Road Networking in Traffic Scenario
por: Xie, Liang, et al.
Publicado: (2025)
por: Xie, Liang, et al.
Publicado: (2025)
Automated Radiology Report Generation Based on Topic-Keyword Semantic Guidance
por: Xiao, Jing, et al.
Publicado: (2025)
por: Xiao, Jing, et al.
Publicado: (2025)
Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation
por: Cao, Jiajun, et al.
Publicado: (2025)
por: Cao, Jiajun, et al.
Publicado: (2025)
UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning
por: Bai, Hayes, et al.
Publicado: (2026)
por: Bai, Hayes, et al.
Publicado: (2026)
LLM2Manim: Pedagogy-Aware AI Generation of STEM Animations
por: Joshi, Aastha, et al.
Publicado: (2026)
por: Joshi, Aastha, et al.
Publicado: (2026)
REAL: Realism Evaluation of Text-to-Image Generation Models for Effective Data Augmentation
por: Li, Ran, et al.
Publicado: (2025)
por: Li, Ran, et al.
Publicado: (2025)
Ejemplares similares
-
Learning Gaussian Data Augmentation in Feature Space for One-shot Object Detection in Manga
por: Taniguchi, Takara, et al.
Publicado: (2024) -
EDGE-Shield: Efficient Denoising-staGE Shield for Violative Content Filtering via Scalable Reference-Based Matching
por: Taniguchi, Takara, et al.
Publicado: (2026) -
MangaUB: A Manga Understanding Benchmark for Large Multimodal Models
por: Ikuta, Hikaru, et al.
Publicado: (2024) -
Harnessing the Latent Diffusion Model for Training-Free Image Style Transfer
por: Masui, Kento, et al.
Publicado: (2024) -
On Parallelism in Music and Language: A Perspective from Symbol Emergence Systems based on Probabilistic Generative Models
por: Taniguchi, Tadahiro
Publicado: (2025)