Saved in:
| Main Authors: | Ye, Zilyu, Liu, Jinxiu, Peng, Ruotian, Cao, Jinjin, Chen, Zhiyang, Zhang, Yiyang, Xuan, Ziwei, Zhou, Mingyuan, Shen, Xiaoqian, Elhoseiny, Mohamed, Liu, Qi, Qi, Guo-Jun |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2408.03695 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
StoryGPT-V: Large Language Models as Consistent Story Visualizers
by: Shen, Xiaoqian, et al.
Published: (2023)
by: Shen, Xiaoqian, et al.
Published: (2023)
Schedule On the Fly: Diffusion Time Prediction for Faster and Better Image Generation
by: Ye, Zilyu, et al.
Published: (2024)
by: Ye, Zilyu, et al.
Published: (2024)
Affective Visual Dialog: A Large-Scale Benchmark for Emotional Reasoning Based on Visually Grounded Conversations
by: Haydarov, Kilichbek, et al.
Published: (2023)
by: Haydarov, Kilichbek, et al.
Published: (2023)
VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding
by: Li, Xiang, et al.
Published: (2024)
by: Li, Xiang, et al.
Published: (2024)
UltrAvatar: A Realistic Animatable 3D Avatar Diffusion Model with Authenticity Guided Textures
by: Zhou, Mingyuan, et al.
Published: (2024)
by: Zhou, Mingyuan, et al.
Published: (2024)
Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding
by: Shen, Xiaoqian, et al.
Published: (2025)
by: Shen, Xiaoqian, et al.
Published: (2025)
Multi-scale 2D Temporal Map Diffusion Models for Natural Language Video Localization
by: Zhang, Chongzhi, et al.
Published: (2024)
by: Zhang, Chongzhi, et al.
Published: (2024)
MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens
by: Ataallah, Kirolos, et al.
Published: (2024)
by: Ataallah, Kirolos, et al.
Published: (2024)
PRIMEdit: Probability Redistribution for Instance-aware Multi-object Video Editing with Benchmark Dataset
by: Teodoro, Samuel, et al.
Published: (2024)
by: Teodoro, Samuel, et al.
Published: (2024)
InstructRL4Pix: Training Diffusion for Image Editing by Reinforcement Learning
by: Li, Tiancheng, et al.
Published: (2024)
by: Li, Tiancheng, et al.
Published: (2024)
Fine-Grained Open-Vocabulary Object Detection with Fined-Grained Prompts: Task, Dataset and Benchmark
by: Liu, Ying, et al.
Published: (2025)
by: Liu, Ying, et al.
Published: (2025)
Improving Time Series Forecasting via Instance-aware Post-hoc Revision
by: Liu, Zhiding, et al.
Published: (2025)
by: Liu, Zhiding, et al.
Published: (2025)
iMotion-LLM: Instruction-Conditioned Trajectory Generation
by: Felemban, Abdulwahab, et al.
Published: (2024)
by: Felemban, Abdulwahab, et al.
Published: (2024)
Context-aware Visual Storytelling with Visual Prefix Tuning and Contrastive Learning
by: Song, Yingjin, et al.
Published: (2024)
by: Song, Yingjin, et al.
Published: (2024)
MULTISCRIPT: Multimodal Script Learning for Supporting Open Domain Everyday Tasks
by: Qi, Jingyuan, et al.
Published: (2023)
by: Qi, Jingyuan, et al.
Published: (2023)
Zoom-Zero: Reinforced Coarse-to-Fine Video Understanding via Temporal Zoom-in
by: Shen, Xiaoqian, et al.
Published: (2025)
by: Shen, Xiaoqian, et al.
Published: (2025)
CoT3DRef: Chain-of-Thoughts Data-Efficient 3D Visual Grounding
by: Abdelrahman, Eslam, et al.
Published: (2023)
by: Abdelrahman, Eslam, et al.
Published: (2023)
InfLVG: Reinforce Inference-Time Consistent Long Video Generation with GRPO
by: Fang, Xueji, et al.
Published: (2025)
by: Fang, Xueji, et al.
Published: (2025)
OpenTracer: A Dynamic Transaction Trace Analyzer for Smart Contract Invariant Generation and Beyond
by: Chen, Zhiyang, et al.
Published: (2024)
by: Chen, Zhiyang, et al.
Published: (2024)
When Images Speak Louder: Mitigating Language Bias-induced Hallucinations in VLMs through Cross-Modal Guidance
by: Cao, Jinjin, et al.
Published: (2025)
by: Cao, Jinjin, et al.
Published: (2025)
Multilingual KokoroChat: A Multi-LLM Ensemble Translation Method for Creating a Multilingual Counseling Dialogue Dataset
by: Suzuki, Ryoma, et al.
Published: (2026)
by: Suzuki, Ryoma, et al.
Published: (2026)
Visual Instance-aware Prompt Tuning
by: Xiao, Xi, et al.
Published: (2025)
by: Xiao, Xi, et al.
Published: (2025)
Convergence analysis of a balancing domain decomposition method for an elliptic optimal control problem with HDG discretizations
by: Liu, Sijing, et al.
Published: (2025)
by: Liu, Sijing, et al.
Published: (2025)
Intelligent Grimm -- Open-ended Visual Storytelling via Latent Diffusion Models
by: Liu, Chang, et al.
Published: (2023)
by: Liu, Chang, et al.
Published: (2023)
Hard-aware Instance Adaptive Self-training for Unsupervised Cross-domain Semantic Segmentation
by: Zhu, Chuang, et al.
Published: (2023)
by: Zhu, Chuang, et al.
Published: (2023)
Improving Generalized Visual Grounding with Instance-aware Joint Learning
by: Dai, Ming, et al.
Published: (2025)
by: Dai, Ming, et al.
Published: (2025)
UniHGKR: Unified Instruction-aware Heterogeneous Knowledge Retrievers
by: Min, Dehai, et al.
Published: (2024)
by: Min, Dehai, et al.
Published: (2024)
A balancing domain decomposition by constraints preconditioner for a hybridizable discontinuous Galerkin discretization of an elliptic optimal control problem
by: Liu, Sijing, et al.
Published: (2025)
by: Liu, Sijing, et al.
Published: (2025)
Privacy Risks in the Storytelling of Open Government Data: A Study from the Perspective of User Cognitive Reasoning
by: Ruili Geng, et al.
Published: (2024)
by: Ruili Geng, et al.
Published: (2024)
M-MiniGPT4: Multilingual VLLM Alignment via Translated Data
by: Han, Seung Hun, et al.
Published: (2026)
by: Han, Seung Hun, et al.
Published: (2026)
3DCoMPaT$^{++}$: An improved Large-scale 3D Vision Dataset for Compositional Recognition
by: Slim, Habib, et al.
Published: (2023)
by: Slim, Habib, et al.
Published: (2023)
FocusDiT: Masking Queries in Diffusion Transformers for Fine-grained Image Generation
by: Fang, Xueji, et al.
Published: (2026)
by: Fang, Xueji, et al.
Published: (2026)
Aligning by Misaligning: Boundary-aware Curriculum Learning for Multimodal Alignment
by: Ye, Hua, et al.
Published: (2025)
by: Ye, Hua, et al.
Published: (2025)
OpenInsGaussian: Open-vocabulary Instance Gaussian Segmentation with Context-aware Cross-view Fusion
by: Huang, Tianyu, et al.
Published: (2025)
by: Huang, Tianyu, et al.
Published: (2025)
Class Agnostic Instance-level Descriptor for Visual Instance Search
by: Sun, Qi-Ying, et al.
Published: (2025)
by: Sun, Qi-Ying, et al.
Published: (2025)
VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?
by: Gado, Mohamed, et al.
Published: (2025)
by: Gado, Mohamed, et al.
Published: (2025)
Data Augmentation Integrating Dialogue Flow and Style to Adapt Spoken Dialogue Systems to Low-Resource User Groups
by: Qi, Zhiyang, et al.
Published: (2024)
by: Qi, Zhiyang, et al.
Published: (2024)
Enhancing Dialogue Generation in Werewolf Game Through Situation Analysis and Persuasion Strategies
by: Qi, Zhiyang, et al.
Published: (2024)
by: Qi, Zhiyang, et al.
Published: (2024)
The asymptoticity of extremal length in Teichmüller space
by: Lyu, Zhiyang, et al.
Published: (2025)
by: Lyu, Zhiyang, et al.
Published: (2025)
RewardDance: Reward Scaling in Visual Generation
by: Wu, Jie, et al.
Published: (2025)
by: Wu, Jie, et al.
Published: (2025)
Similar Items
-
StoryGPT-V: Large Language Models as Consistent Story Visualizers
by: Shen, Xiaoqian, et al.
Published: (2023) -
Schedule On the Fly: Diffusion Time Prediction for Faster and Better Image Generation
by: Ye, Zilyu, et al.
Published: (2024) -
Affective Visual Dialog: A Large-Scale Benchmark for Emotional Reasoning Based on Visually Grounded Conversations
by: Haydarov, Kilichbek, et al.
Published: (2023) -
VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding
by: Li, Xiang, et al.
Published: (2024) -
UltrAvatar: A Realistic Animatable 3D Avatar Diffusion Model with Authenticity Guided Textures
by: Zhou, Mingyuan, et al.
Published: (2024)