TARN-VIST: Topic Aware Reinforcement Network for Visual Storytelling
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Chen, Weiran, Li, Xin, Su, Jiaqi, Zhu, Guiqian, Li, Ying, Ji, Yi, Liu, Chunping |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
DA-Font: Few-Shot Font Generation via Dual-Attention Hybrid Integration
von: Chen, Weiran, et al.
Veröffentlicht: (2025)
von: Chen, Weiran, et al.
Veröffentlicht: (2025)
Advancements in Chinese font generation since deep learning era: A survey
von: Chen, Weiran, et al.
Veröffentlicht: (2025)
von: Chen, Weiran, et al.
Veröffentlicht: (2025)
VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?
von: Gado, Mohamed, et al.
Veröffentlicht: (2025)
von: Gado, Mohamed, et al.
Veröffentlicht: (2025)
SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling
von: Wang, Eileen, et al.
Veröffentlicht: (2024)
von: Wang, Eileen, et al.
Veröffentlicht: (2024)
Customized Visual Storytelling with Unified Multimodal LLMs
von: Li, Wei-Hua, et al.
Veröffentlicht: (2026)
von: Li, Wei-Hua, et al.
Veröffentlicht: (2026)
Dialogue Director: Bridging the Gap in Dialogue Visualization for Multimodal Storytelling
von: Zhang, Min, et al.
Veröffentlicht: (2024)
von: Zhang, Min, et al.
Veröffentlicht: (2024)
Improving Visual Storytelling with Multimodal Large Language Models
von: Lin, Xiaochuan, et al.
Veröffentlicht: (2024)
von: Lin, Xiaochuan, et al.
Veröffentlicht: (2024)
Robust 4D Visual Geometry Transformer with Uncertainty-Aware Priors
von: Zang, Ying, et al.
Veröffentlicht: (2026)
von: Zang, Ying, et al.
Veröffentlicht: (2026)
Context-Aware Interaction Network for RGB-T Semantic Segmentation
von: Lv, Ying, et al.
Veröffentlicht: (2024)
von: Lv, Ying, et al.
Veröffentlicht: (2024)
From Image Captioning to Visual Storytelling
von: Passadakis, Admitos, et al.
Veröffentlicht: (2025)
von: Passadakis, Admitos, et al.
Veröffentlicht: (2025)
Visual-RFT: Visual Reinforcement Fine-Tuning
von: Liu, Ziyu, et al.
Veröffentlicht: (2025)
von: Liu, Ziyu, et al.
Veröffentlicht: (2025)
Story3D-Agent: Exploring 3D Storytelling Visualization with Large Language Models
von: Huang, Yuzhou, et al.
Veröffentlicht: (2024)
von: Huang, Yuzhou, et al.
Veröffentlicht: (2024)
Compositional Feature Augmentation for Unbiased Scene Graph Generation
von: Li, Lin, et al.
Veröffentlicht: (2023)
von: Li, Lin, et al.
Veröffentlicht: (2023)
From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts
von: Li, Weiran, et al.
Veröffentlicht: (2025)
von: Li, Weiran, et al.
Veröffentlicht: (2025)
Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models
von: Liu, Chang, et al.
Veröffentlicht: (2023)
von: Liu, Chang, et al.
Veröffentlicht: (2023)
On the Suitability of Reinforcement Fine-Tuning to Visual Tasks
von: Chen, Xiaxu, et al.
Veröffentlicht: (2025)
von: Chen, Xiaxu, et al.
Veröffentlicht: (2025)
Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank
von: Chen, Xiangyong, et al.
Veröffentlicht: (2026)
von: Chen, Xiangyong, et al.
Veröffentlicht: (2026)
Openstory++: A Large-scale Dataset and Benchmark for Instance-aware Open-domain Visual Storytelling
von: Ye, Zilyu, et al.
Veröffentlicht: (2024)
von: Ye, Zilyu, et al.
Veröffentlicht: (2024)
Self-Consistent Model-based Adaptation for Visual Reinforcement Learning
von: Zhou, Xinning, et al.
Veröffentlicht: (2025)
von: Zhou, Xinning, et al.
Veröffentlicht: (2025)
Context-aware Visual Storytelling with Visual Prefix Tuning and Contrastive Learning
von: Song, Yingjin, et al.
Veröffentlicht: (2024)
von: Song, Yingjin, et al.
Veröffentlicht: (2024)
SPoRC-VIST: A Benchmark for Evaluating Generative Natural Narrative in Vision-Language Models
von: Zeng, Yunlin
Veröffentlicht: (2026)
von: Zeng, Yunlin
Veröffentlicht: (2026)
ESG-Net: Event-Aware Semantic Guided Network for Dense Audio-Visual Event Localization
von: Li, Huilai, et al.
Veröffentlicht: (2025)
von: Li, Huilai, et al.
Veröffentlicht: (2025)
CoDA: Instructive Chain-of-Domain Adaptation with Severity-Aware Visual Prompt Tuning
von: Gong, Ziyang, et al.
Veröffentlicht: (2024)
von: Gong, Ziyang, et al.
Veröffentlicht: (2024)
AttriStory: Fine-grained Attribute Realization for Visual Storytelling with Diffusion Models
von: Sreenivas, Manogna, et al.
Veröffentlicht: (2026)
von: Sreenivas, Manogna, et al.
Veröffentlicht: (2026)
Let Storytelling Tell Vivid Stories: An Expressive and Fluent Multimodal Storyteller
von: Zang, Chuanqi, et al.
Veröffentlicht: (2024)
von: Zang, Chuanqi, et al.
Veröffentlicht: (2024)
Robust and Efficient Adversarial Defense in SNNs via Image Purification and Joint Detection
von: Chen, Weiran, et al.
Veröffentlicht: (2024)
von: Chen, Weiran, et al.
Veröffentlicht: (2024)
Seeing Beyond Classes: Zero-Shot Grounded Situation Recognition via Language Explainer
von: Lei, Jiaming, et al.
Veröffentlicht: (2024)
von: Lei, Jiaming, et al.
Veröffentlicht: (2024)
DreamVAR: Taming Reinforced Visual Autoregressive Model for High-Fidelity Subject-Driven Image Generation
von: Jiang, Xin, et al.
Veröffentlicht: (2026)
von: Jiang, Xin, et al.
Veröffentlicht: (2026)
Visual-CoG: Stage-Aware Reinforcement Learning with Chain of Guidance for Text-to-Image Generation
von: Li, Yaqi, et al.
Veröffentlicht: (2025)
von: Li, Yaqi, et al.
Veröffentlicht: (2025)
HD-VGGT: High-Resolution Visual Geometry Transformer
von: Chen, Tianrun, et al.
Veröffentlicht: (2026)
von: Chen, Tianrun, et al.
Veröffentlicht: (2026)
Lightweight Pixel Difference Networks for Efficient Visual Representation Learning
von: Su, Zhuo, et al.
Veröffentlicht: (2024)
von: Su, Zhuo, et al.
Veröffentlicht: (2024)
Generating Storytelling Images with Rich Chains-of-Reasoning
von: Song, Xiujie, et al.
Veröffentlicht: (2025)
von: Song, Xiujie, et al.
Veröffentlicht: (2025)
Context-Semantic Quality Awareness Network for Fine-Grained Visual Categorization
von: Xu, Qin, et al.
Veröffentlicht: (2024)
von: Xu, Qin, et al.
Veröffentlicht: (2024)
Integrating Reinforcement Learning with Visual Generative Models: Foundations and Advances
von: Liang, Yuanzhi, et al.
Veröffentlicht: (2025)
von: Liang, Yuanzhi, et al.
Veröffentlicht: (2025)
Dynamic Embedding of Hierarchical Visual Features for Efficient Vision-Language Fine-Tuning
von: Wei, Xinyu, et al.
Veröffentlicht: (2025)
von: Wei, Xinyu, et al.
Veröffentlicht: (2025)
Semantic-Aware Visual Information Transmission With Key Information Extraction Over Wireless Networks
von: Zhu, Chen, et al.
Veröffentlicht: (2025)
von: Zhu, Chen, et al.
Veröffentlicht: (2025)
ExtraVAR: Stage-Aware RoPE Remapping for Resolution Extrapolation in Visual Autoregressive Models
von: Yan, Feihong, et al.
Veröffentlicht: (2026)
von: Yan, Feihong, et al.
Veröffentlicht: (2026)
MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
von: Chen, Xi, et al.
Veröffentlicht: (2025)
von: Chen, Xi, et al.
Veröffentlicht: (2025)
OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
von: Su, Zhaochen, et al.
Veröffentlicht: (2025)
AnimeAgent: Is the Multi-Agent via Image-to-Video models a Good Disney Storytelling Artist?
von: Yan, Hailong, et al.
Veröffentlicht: (2026)
von: Yan, Hailong, et al.
Veröffentlicht: (2026)
Ähnliche Einträge
-
DA-Font: Few-Shot Font Generation via Dual-Attention Hybrid Integration
von: Chen, Weiran, et al.
Veröffentlicht: (2025) -
Advancements in Chinese font generation since deep learning era: A survey
von: Chen, Weiran, et al.
Veröffentlicht: (2025) -
VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?
von: Gado, Mohamed, et al.
Veröffentlicht: (2025) -
SCO-VIST: Social Interaction Commonsense Knowledge-based Visual Storytelling
von: Wang, Eileen, et al.
Veröffentlicht: (2024) -
Customized Visual Storytelling with Unified Multimodal LLMs
von: Li, Wei-Hua, et al.
Veröffentlicht: (2026)