SEED-Story: Multimodal Long Story Generation with Large Language Model
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Shuai, Ge, Yuying, Li, Yang, Chen, Yukang, Ge, Yixiao, Shan, Ying, Chen, Yingcong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
di: Li, Bohao, et al.
Pubblicazione: (2024)
di: Li, Bohao, et al.
Pubblicazione: (2024)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
di: Guo, Yuxin, et al.
Pubblicazione: (2025)
SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing
di: Ge, Yuying, et al.
Pubblicazione: (2024)
di: Ge, Yuying, et al.
Pubblicazione: (2024)
SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation
di: Ge, Yuying, et al.
Pubblicazione: (2024)
di: Ge, Yuying, et al.
Pubblicazione: (2024)
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
di: Li, Yizhuo, et al.
Pubblicazione: (2024)
di: Li, Yizhuo, et al.
Pubblicazione: (2024)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
di: Qiu, Lu, et al.
Pubblicazione: (2024)
di: Qiu, Lu, et al.
Pubblicazione: (2024)
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
di: Ge, Yuying, et al.
Pubblicazione: (2024)
di: Ge, Yuying, et al.
Pubblicazione: (2024)
ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries
di: Pu, Junfu, et al.
Pubblicazione: (2025)
di: Pu, Junfu, et al.
Pubblicazione: (2025)
Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
di: Chen, Yi, et al.
Pubblicazione: (2023)
di: Chen, Yi, et al.
Pubblicazione: (2023)
ST-LLM: Large Language Models Are Effective Temporal Learners
di: Liu, Ruyang, et al.
Pubblicazione: (2024)
di: Liu, Ruyang, et al.
Pubblicazione: (2024)
GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers
di: Ma, Shijie, et al.
Pubblicazione: (2025)
di: Ma, Shijie, et al.
Pubblicazione: (2025)
AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation
di: Qiu, Lu, et al.
Pubblicazione: (2025)
di: Qiu, Lu, et al.
Pubblicazione: (2025)
Denoising Diffusion Step-aware Models
di: Yang, Shuai, et al.
Pubblicazione: (2023)
di: Yang, Shuai, et al.
Pubblicazione: (2023)
AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
Aligning Latent Spaces with Flow Priors
di: Li, Yizhuo, et al.
Pubblicazione: (2025)
di: Li, Yizhuo, et al.
Pubblicazione: (2025)
VoCo-LLaMA: Towards Vision Compression with Large Language Models
di: Ye, Xubing, et al.
Pubblicazione: (2024)
di: Ye, Xubing, et al.
Pubblicazione: (2024)
EmoStory: Emotion-Aware Story Generation
di: Yang, Jingyuan, et al.
Pubblicazione: (2026)
di: Yang, Jingyuan, et al.
Pubblicazione: (2026)
ATP-LLaVA: Adaptive Token Pruning for Large Vision Language Models
di: Ye, Xubing, et al.
Pubblicazione: (2024)
di: Ye, Xubing, et al.
Pubblicazione: (2024)
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
di: Cheng, Junhao, et al.
Pubblicazione: (2025)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
di: Chen, Yi, et al.
Pubblicazione: (2025)
di: Chen, Yi, et al.
Pubblicazione: (2025)
Supervised Fine-tuning in turn Improves Visual Foundation Models
di: Jiang, Xiaohu, et al.
Pubblicazione: (2024)
di: Jiang, Xiaohu, et al.
Pubblicazione: (2024)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
di: Zhang, Jun, et al.
Pubblicazione: (2025)
di: Zhang, Jun, et al.
Pubblicazione: (2025)
TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation
di: Lin, Haokun, et al.
Pubblicazione: (2025)
di: Lin, Haokun, et al.
Pubblicazione: (2025)
LongLive: Real-time Interactive Long Video Generation
di: Yang, Shuai, et al.
Pubblicazione: (2025)
di: Yang, Shuai, et al.
Pubblicazione: (2025)
StoryGPT-V: Large Language Models as Consistent Story Visualizers
di: Shen, Xiaoqian, et al.
Pubblicazione: (2023)
di: Shen, Xiaoqian, et al.
Pubblicazione: (2023)
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
di: Liu, Ruyang, et al.
Pubblicazione: (2023)
di: Liu, Ruyang, et al.
Pubblicazione: (2023)
Story3D-Agent: Exploring 3D Storytelling Visualization with Large Language Models
di: Huang, Yuzhou, et al.
Pubblicazione: (2024)
di: Huang, Yuzhou, et al.
Pubblicazione: (2024)
Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos
di: Chen, Yi, et al.
Pubblicazione: (2024)
di: Chen, Yi, et al.
Pubblicazione: (2024)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
di: Zhou, Shengchao, et al.
Pubblicazione: (2025)
di: Zhou, Shengchao, et al.
Pubblicazione: (2025)
ReDiStory: Region-Disentangled Diffusion for Consistent Visual Story Generation
di: Sarkar, Ayushman, et al.
Pubblicazione: (2026)
di: Sarkar, Ayushman, et al.
Pubblicazione: (2026)
Towards Long Video Understanding via Fine-detailed Video Story Generation
di: You, Zeng, et al.
Pubblicazione: (2024)
di: You, Zeng, et al.
Pubblicazione: (2024)
IdentityStory: Taming Your Identity-Preserving Generator for Human-Centric Story Generation
di: Zhou, Donghao, et al.
Pubblicazione: (2025)
di: Zhou, Donghao, et al.
Pubblicazione: (2025)
Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific Plots
di: Wu, Chengyue, et al.
Pubblicazione: (2024)
di: Wu, Chengyue, et al.
Pubblicazione: (2024)
Story-Iter: A Training-free Iterative Paradigm for Long Story Visualization
di: Mao, Jiawei, et al.
Pubblicazione: (2024)
di: Mao, Jiawei, et al.
Pubblicazione: (2024)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
Meta-Adapter: An Online Few-shot Learner for Vision-Language Model
di: Cheng, Cheng, et al.
Pubblicazione: (2023)
di: Cheng, Cheng, et al.
Pubblicazione: (2023)
Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation
di: Luo, Zhuoyan, et al.
Pubblicazione: (2024)
di: Luo, Zhuoyan, et al.
Pubblicazione: (2024)
DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA
di: Chen, Yi, et al.
Pubblicazione: (2026)
di: Chen, Yi, et al.
Pubblicazione: (2026)
Video Emotion Open-vocabulary Recognition Based on Multimodal Large Language Model
di: Ge, Mengying, et al.
Pubblicazione: (2024)
di: Ge, Mengying, et al.
Pubblicazione: (2024)
Documenti analoghi
-
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
di: Li, Bohao, et al.
Pubblicazione: (2024) -
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
di: Guo, Yuxin, et al.
Pubblicazione: (2025) -
SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing
di: Ge, Yuying, et al.
Pubblicazione: (2024) -
SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation
di: Ge, Yuying, et al.
Pubblicazione: (2024) -
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
di: Li, Yizhuo, et al.
Pubblicazione: (2024)