Enregistré dans:
| Auteurs principaux: | Taniguchi, Takara, Shimoda, Wataru, Yamaguchi, Kota, Nakayama, Hideki |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2509.24331 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning Gaussian Data Augmentation in Feature Space for One-shot Object Detection in Manga
par: Taniguchi, Takara, et autres
Publié: (2024)
par: Taniguchi, Takara, et autres
Publié: (2024)
EDGE-Shield: Efficient Denoising-staGE Shield for Violative Content Filtering via Scalable Reference-Based Matching
par: Taniguchi, Takara, et autres
Publié: (2026)
par: Taniguchi, Takara, et autres
Publié: (2026)
MangaUB: A Manga Understanding Benchmark for Large Multimodal Models
par: Ikuta, Hikaru, et autres
Publié: (2024)
par: Ikuta, Hikaru, et autres
Publié: (2024)
Harnessing the Latent Diffusion Model for Training-Free Image Style Transfer
par: Masui, Kento, et autres
Publié: (2024)
par: Masui, Kento, et autres
Publié: (2024)
On Parallelism in Music and Language: A Perspective from Symbol Emergence Systems based on Probabilistic Generative Models
par: Taniguchi, Tadahiro
Publié: (2025)
par: Taniguchi, Tadahiro
Publié: (2025)
OTR: Synthesizing Overlay Text Dataset for Text Removal
par: Zdenek, Jan, et autres
Publié: (2025)
par: Zdenek, Jan, et autres
Publié: (2025)
Multimodal Markup Document Models for Graphic Design Completion
par: Kikuchi, Kotaro, et autres
Publié: (2024)
par: Kikuchi, Kotaro, et autres
Publié: (2024)
OpenCOLE: Towards Reproducible Automatic Graphic Design Generation
par: Inoue, Naoto, et autres
Publié: (2024)
par: Inoue, Naoto, et autres
Publié: (2024)
FashionReGen: LLM-Empowered Fashion Report Generation
par: Ding, Yujuan, et autres
Publié: (2024)
par: Ding, Yujuan, et autres
Publié: (2024)
AdaptaGen: Domain-Specific Image Generation through Hierarchical Semantic Optimization Framework
par: Zhang, Suoxiang, et autres
Publié: (2025)
par: Zhang, Suoxiang, et autres
Publié: (2025)
LipGen: Viseme-Guided Lip Video Generation for Enhancing Visual Speech Recognition
par: Hao, Bowen, et autres
Publié: (2025)
par: Hao, Bowen, et autres
Publié: (2025)
CAFE: Channel-Autoregressive Factorized Encoding for Robust Biosignal Spatial Super-Resolution
par: Liu, Hongjun, et autres
Publié: (2026)
par: Liu, Hongjun, et autres
Publié: (2026)
MindFuse: Towards GenAI Explainability in Marketing Strategy Co-Creation
par: Farseev, Aleksandr, et autres
Publié: (2025)
par: Farseev, Aleksandr, et autres
Publié: (2025)
A 3D Framework for Improving Low-Latency Multi-Channel Live Streaming
par: Aiersilan, Aizierjiang, et autres
Publié: (2024)
par: Aiersilan, Aizierjiang, et autres
Publié: (2024)
Immersive Fantasy Based on Digital Nostalgia: Environmental Narratives for the Korean Millennials and Gen Z
par: Doh, Yerin, et autres
Publié: (2025)
par: Doh, Yerin, et autres
Publié: (2025)
Face Consistency Benchmark for GenAI Video
par: Podstawski, Michal, et autres
Publié: (2025)
par: Podstawski, Michal, et autres
Publié: (2025)
Total Disentanglement of Font Images into Style and Character Class Features
par: Haraguchi, Daichi, et autres
Publié: (2024)
par: Haraguchi, Daichi, et autres
Publié: (2024)
PanoGen++: Domain-Adapted Text-Guided Panoramic Environment Generation for Vision-and-Language Navigation
par: Wang, Sen, et autres
Publié: (2025)
par: Wang, Sen, et autres
Publié: (2025)
A Low-Latency 3D Live Remote Visualization System for Tourist Sites Integrating Dynamic and Pre-captured Static Point Clouds
par: Matsumoto, Takahiro, et autres
Publié: (2025)
par: Matsumoto, Takahiro, et autres
Publié: (2025)
GenState-AI: State-Aware Dataset for Text-to-Video Retrieval on AI-Generated Videos
par: Li, Minghan, et autres
Publié: (2026)
par: Li, Minghan, et autres
Publié: (2026)
Generative AI-enabled Mobile Tactical Multimedia Networks: Distribution, Generation, and Perception
par: Xu, Minrui, et autres
Publié: (2024)
par: Xu, Minrui, et autres
Publié: (2024)
Hyperbolic Multimodal Generative Representation Learning for Generalized Zero-Shot Multimodal Information Extraction
par: Zhou, Baohang, et autres
Publié: (2026)
par: Zhou, Baohang, et autres
Publié: (2026)
MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation
par: Wang, Muyao, et autres
Publié: (2026)
par: Wang, Muyao, et autres
Publié: (2026)
Editing on the Generative Manifold: A Theoretical and Empirical Study of General Diffusion-Based Image Editing Trade-offs
par: Hu, Yi, et autres
Publié: (2026)
par: Hu, Yi, et autres
Publié: (2026)
DeepStream: Prototyping Deep Joint Source-Channel Coding for Real-Time Multimedia Transmissions
par: Chi, Kaiyi, et autres
Publié: (2025)
par: Chi, Kaiyi, et autres
Publié: (2025)
PiGW: A Plug-in Generative Watermarking Framework
par: Ma, Rui, et autres
Publié: (2024)
par: Ma, Rui, et autres
Publié: (2024)
Cap2Sum: Learning to Summarize Videos by Generating Captions
par: Zhao, Cairong, et autres
Publié: (2024)
par: Zhao, Cairong, et autres
Publié: (2024)
Virbo: Multimodal Multilingual Avatar Video Generation in Digital Marketing
par: Zhang, Juan, et autres
Publié: (2024)
par: Zhang, Juan, et autres
Publié: (2024)
Synchronized Video Storytelling: Generating Video Narrations with Structured Storyline
par: Yang, Dingyi, et autres
Publié: (2024)
par: Yang, Dingyi, et autres
Publié: (2024)
Multi-Reference Generative Face Video Compression with Contrastive Learning
par: Konuko, Goluck, et autres
Publié: (2024)
par: Konuko, Goluck, et autres
Publié: (2024)
Analyzing Recursiveness in Multimodal Generative Artificial Intelligence: Stability or Divergence?
par: Conde, Javier, et autres
Publié: (2024)
par: Conde, Javier, et autres
Publié: (2024)
Multimodal Semantic Communication for Generative Audio-Driven Video Conferencing
par: Tong, Haonan, et autres
Publié: (2024)
par: Tong, Haonan, et autres
Publié: (2024)
MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization
par: Yang, Jianxuan, et autres
Publié: (2025)
par: Yang, Jianxuan, et autres
Publié: (2025)
Latent Feature-Guided Conditional Diffusion for Generative Image Semantic Communication
par: Chen, Zehao, et autres
Publié: (2025)
par: Chen, Zehao, et autres
Publié: (2025)
Automatically Generating High-Precision Simulated Road Networking in Traffic Scenario
par: Xie, Liang, et autres
Publié: (2025)
par: Xie, Liang, et autres
Publié: (2025)
Automated Radiology Report Generation Based on Topic-Keyword Semantic Guidance
par: Xiao, Jing, et autres
Publié: (2025)
par: Xiao, Jing, et autres
Publié: (2025)
Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation
par: Cao, Jiajun, et autres
Publié: (2025)
par: Cao, Jiajun, et autres
Publié: (2025)
UniPath: Adaptive Coordination of Understanding and Generation for Unified Multimodal Reasoning
par: Bai, Hayes, et autres
Publié: (2026)
par: Bai, Hayes, et autres
Publié: (2026)
LLM2Manim: Pedagogy-Aware AI Generation of STEM Animations
par: Joshi, Aastha, et autres
Publié: (2026)
par: Joshi, Aastha, et autres
Publié: (2026)
REAL: Realism Evaluation of Text-to-Image Generation Models for Effective Data Augmentation
par: Li, Ran, et autres
Publié: (2025)
par: Li, Ran, et autres
Publié: (2025)
Documents similaires
-
Learning Gaussian Data Augmentation in Feature Space for One-shot Object Detection in Manga
par: Taniguchi, Takara, et autres
Publié: (2024) -
EDGE-Shield: Efficient Denoising-staGE Shield for Violative Content Filtering via Scalable Reference-Based Matching
par: Taniguchi, Takara, et autres
Publié: (2026) -
MangaUB: A Manga Understanding Benchmark for Large Multimodal Models
par: Ikuta, Hikaru, et autres
Publié: (2024) -
Harnessing the Latent Diffusion Model for Training-Free Image Style Transfer
par: Masui, Kento, et autres
Publié: (2024) -
On Parallelism in Music and Language: A Perspective from Symbol Emergence Systems based on Probabilistic Generative Models
par: Taniguchi, Tadahiro
Publié: (2025)