Salvato in:
| Autori principali: | Taniguchi, Takara, Shimoda, Wataru, Yamaguchi, Kota, Nakayama, Hideki |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2509.24331 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning Gaussian Data Augmentation in Feature Space for One-shot Object Detection in Manga
di: Taniguchi, Takara, et al.
Pubblicazione: (2024)
di: Taniguchi, Takara, et al.
Pubblicazione: (2024)
EDGE-Shield: Efficient Denoising-staGE Shield for Violative Content Filtering via Scalable Reference-Based Matching
di: Taniguchi, Takara, et al.
Pubblicazione: (2026)
di: Taniguchi, Takara, et al.
Pubblicazione: (2026)
MangaUB: A Manga Understanding Benchmark for Large Multimodal Models
di: Ikuta, Hikaru, et al.
Pubblicazione: (2024)
di: Ikuta, Hikaru, et al.
Pubblicazione: (2024)
Harnessing the Latent Diffusion Model for Training-Free Image Style Transfer
di: Masui, Kento, et al.
Pubblicazione: (2024)
di: Masui, Kento, et al.
Pubblicazione: (2024)
On Parallelism in Music and Language: A Perspective from Symbol Emergence Systems based on Probabilistic Generative Models
di: Taniguchi, Tadahiro
Pubblicazione: (2025)
di: Taniguchi, Tadahiro
Pubblicazione: (2025)
OTR: Synthesizing Overlay Text Dataset for Text Removal
di: Zdenek, Jan, et al.
Pubblicazione: (2025)
di: Zdenek, Jan, et al.
Pubblicazione: (2025)
Multimodal Markup Document Models for Graphic Design Completion
di: Kikuchi, Kotaro, et al.
Pubblicazione: (2024)
di: Kikuchi, Kotaro, et al.
Pubblicazione: (2024)
OpenCOLE: Towards Reproducible Automatic Graphic Design Generation
di: Inoue, Naoto, et al.
Pubblicazione: (2024)
di: Inoue, Naoto, et al.
Pubblicazione: (2024)
FashionReGen: LLM-Empowered Fashion Report Generation
di: Ding, Yujuan, et al.
Pubblicazione: (2024)
di: Ding, Yujuan, et al.
Pubblicazione: (2024)
AdaptaGen: Domain-Specific Image Generation through Hierarchical Semantic Optimization Framework
di: Zhang, Suoxiang, et al.
Pubblicazione: (2025)
di: Zhang, Suoxiang, et al.
Pubblicazione: (2025)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
di: Hao, Bowen, et al.
Pubblicazione: (2025)
di: Hao, Bowen, et al.
Pubblicazione: (2025)
CAFE: Channel-Autoregressive Factorized Encoding for Robust Biosignal Spatial Super-Resolution
di: Liu, Hongjun, et al.
Pubblicazione: (2026)
di: Liu, Hongjun, et al.
Pubblicazione: (2026)
MindFuse: Towards GenAI Explainability in Marketing Strategy Co-Creation
di: Farseev, Aleksandr, et al.
Pubblicazione: (2025)
di: Farseev, Aleksandr, et al.
Pubblicazione: (2025)
A 3D Framework for Improving Low-Latency Multi-Channel Live Streaming
di: Aiersilan, Aizierjiang, et al.
Pubblicazione: (2024)
di: Aiersilan, Aizierjiang, et al.
Pubblicazione: (2024)
Immersive Fantasy Based on Digital Nostalgia: Environmental Narratives for the Korean Millennials and Gen Z
di: Doh, Yerin, et al.
Pubblicazione: (2025)
di: Doh, Yerin, et al.
Pubblicazione: (2025)
Face Consistency Benchmark for GenAI Video
di: Podstawski, Michal, et al.
Pubblicazione: (2025)
di: Podstawski, Michal, et al.
Pubblicazione: (2025)
Total Disentanglement of Font Images into Style and Character Class Features
di: Haraguchi, Daichi, et al.
Pubblicazione: (2024)
di: Haraguchi, Daichi, et al.
Pubblicazione: (2024)
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
di: Wang, Sen, et al.
Pubblicazione: (2025)
di: Wang, Sen, et al.
Pubblicazione: (2025)
A Low-Latency 3D Live Remote Visualization System for Tourist Sites Integrating Dynamic and Pre-captured Static Point Clouds
di: Matsumoto, Takahiro, et al.
Pubblicazione: (2025)
di: Matsumoto, Takahiro, et al.
Pubblicazione: (2025)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
di: Li, Minghan, et al.
Pubblicazione: (2026)
di: Li, Minghan, et al.
Pubblicazione: (2026)
Generative AI-enabled Mobile Tactical Multimedia Networks: Distribution, Generation, and Perception
di: Xu, Minrui, et al.
Pubblicazione: (2024)
di: Xu, Minrui, et al.
Pubblicazione: (2024)
Hyperbolic Multimodal Generative Representation Learning for Generalized Zero-Shot Multimodal Information Extraction
di: Zhou, Baohang, et al.
Pubblicazione: (2026)
di: Zhou, Baohang, et al.
Pubblicazione: (2026)
MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation
di: Wang, Muyao, et al.
Pubblicazione: (2026)
di: Wang, Muyao, et al.
Pubblicazione: (2026)
Editing on the Generative Manifold: A Theoretical and Empirical Study of General Diffusion-Based Image Editing Trade-offs
di: Hu, Yi, et al.
Pubblicazione: (2026)
di: Hu, Yi, et al.
Pubblicazione: (2026)
DeepStream: Prototyping Deep Joint Source-Channel Coding for Real-Time Multimedia Transmissions
di: Chi, Kaiyi, et al.
Pubblicazione: (2025)
di: Chi, Kaiyi, et al.
Pubblicazione: (2025)
PiGW: A Plug-in Generative Watermarking Framework
di: Ma, Rui, et al.
Pubblicazione: (2024)
di: Ma, Rui, et al.
Pubblicazione: (2024)
Cap2Sum: Learning to Summarize Videos by Generating Captions
di: Zhao, Cairong, et al.
Pubblicazione: (2024)
di: Zhao, Cairong, et al.
Pubblicazione: (2024)
Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing
di: Zhang, Juan, et al.
Pubblicazione: (2024)
di: Zhang, Juan, et al.
Pubblicazione: (2024)
Synchronized Video Storytelling: Generating Video Narrations with Structured Storyline
di: Yang, Dingyi, et al.
Pubblicazione: (2024)
di: Yang, Dingyi, et al.
Pubblicazione: (2024)
Multi-Reference Generative Face Video Compression with Contrastive Learning
di: Konuko, Goluck, et al.
Pubblicazione: (2024)
di: Konuko, Goluck, et al.
Pubblicazione: (2024)
Analyzing Recursiveness in Multimodal Generative Artificial Intelligence: Stability or Divergence?
di: Conde, Javier, et al.
Pubblicazione: (2024)
di: Conde, Javier, et al.
Pubblicazione: (2024)
Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
di: Tong, Haonan, et al.
Pubblicazione: (2024)
di: Tong, Haonan, et al.
Pubblicazione: (2024)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
di: Yang, Jianxuan, et al.
Pubblicazione: (2025)
Latent Feature-Guided Conditional Diffusion for Generative Image Semantic Communication
di: Chen, Zehao, et al.
Pubblicazione: (2025)
di: Chen, Zehao, et al.
Pubblicazione: (2025)
Automatically Generating High-Precision Simulated Road Networking in Traffic Scenario
di: Xie, Liang, et al.
Pubblicazione: (2025)
di: Xie, Liang, et al.
Pubblicazione: (2025)
Automated Radiology Report Generation Based on Topic-Keyword Semantic Guidance
di: Xiao, Jing, et al.
Pubblicazione: (2025)
di: Xiao, Jing, et al.
Pubblicazione: (2025)
Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation
di: Cao, Jiajun, et al.
Pubblicazione: (2025)
di: Cao, Jiajun, et al.
Pubblicazione: (2025)
UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning
di: Bai, Hayes, et al.
Pubblicazione: (2026)
di: Bai, Hayes, et al.
Pubblicazione: (2026)
LLM2Manim: Pedagogy-Aware AI Generation of STEM Animations
di: Joshi, Aastha, et al.
Pubblicazione: (2026)
di: Joshi, Aastha, et al.
Pubblicazione: (2026)
REAL: Realism Evaluation of Text-to-Image Generation Models for Effective Data Augmentation
di: Li, Ran, et al.
Pubblicazione: (2025)
di: Li, Ran, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Learning Gaussian Data Augmentation in Feature Space for One-shot Object Detection in Manga
di: Taniguchi, Takara, et al.
Pubblicazione: (2024) -
EDGE-Shield: Efficient Denoising-staGE Shield for Violative Content Filtering via Scalable Reference-Based Matching
di: Taniguchi, Takara, et al.
Pubblicazione: (2026) -
MangaUB: A Manga Understanding Benchmark for Large Multimodal Models
di: Ikuta, Hikaru, et al.
Pubblicazione: (2024) -
Harnessing the Latent Diffusion Model for Training-Free Image Style Transfer
di: Masui, Kento, et al.
Pubblicazione: (2024) -
On Parallelism in Music and Language: A Perspective from Symbol Emergence Systems based on Probabilistic Generative Models
di: Taniguchi, Tadahiro
Pubblicazione: (2025)