SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ge, Yuying, Zhao, Sijie, Zhu, Jinguo, Ge, Yixiao, Yi, Kun, Song, Lin, Li, Chen, Ding, Xiaohan, Shan, Ying |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing
par: Ge, Yuying, et autres
Publié: (2024)
par: Ge, Yuying, et autres
Publié: (2024)
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
par: Li, Bohao, et autres
Publié: (2024)
par: Li, Bohao, et autres
Publié: (2024)
SEED-Story: Multimodal Long Story Generation with Large Language Model
par: Yang, Shuai, et autres
Publié: (2024)
par: Yang, Shuai, et autres
Publié: (2024)
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
par: Ge, Yuying, et autres
Publié: (2024)
par: Ge, Yuying, et autres
Publié: (2024)
Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
TokLIP: Marry Visual Tokens to CLIP for Multimodal Comprehension and Generation
par: Lin, Haokun, et autres
Publié: (2025)
par: Lin, Haokun, et autres
Publié: (2025)
UniRepLKNet: A Universal Perception Large-Kernel ConvNet for Audio, Video, Point Cloud, Time-Series and Image Recognition
par: Ding, Xiaohan, et autres
Publié: (2023)
par: Ding, Xiaohan, et autres
Publié: (2023)
AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation
par: Qiu, Lu, et autres
Publié: (2025)
par: Qiu, Lu, et autres
Publié: (2025)
DiCoDe: Diffusion-Compressed Deep Tokens for Autoregressive Video Generation with Language Models
par: Li, Yizhuo, et autres
Publié: (2024)
par: Li, Yizhuo, et autres
Publié: (2024)
EgoPlan-Bench2: A Benchmark for Multimodal Large Language Model Planning in Real-World Scenarios
par: Qiu, Lu, et autres
Publié: (2024)
par: Qiu, Lu, et autres
Publié: (2024)
AnimeGamer: Infinite Anime Life Simulation with Next Game State Prediction
par: Cheng, Junhao, et autres
Publié: (2025)
par: Cheng, Junhao, et autres
Publié: (2025)
GenHancer: Imperfect Generative Models are Secretly Strong Vision-Centric Enhancers
par: Ma, Shijie, et autres
Publié: (2025)
par: Ma, Shijie, et autres
Publié: (2025)
Aligning Latent Spaces with Flow Priors
par: Li, Yizhuo, et autres
Publié: (2025)
par: Li, Yizhuo, et autres
Publié: (2025)
GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning
par: Chen, Yi, et autres
Publié: (2025)
par: Chen, Yi, et autres
Publié: (2025)
Multimodal Pathway: Improve Transformers with Irrelevant Data from Other Modalities
par: Zhang, Yiyuan, et autres
Publié: (2024)
par: Zhang, Yiyuan, et autres
Publié: (2024)
EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning
par: Chen, Yi, et autres
Publié: (2023)
par: Chen, Yi, et autres
Publié: (2023)
ARC-Chapter: Structuring Hour-Long Videos into Navigable Chapters and Hierarchical Summaries
par: Pu, Junfu, et autres
Publié: (2025)
par: Pu, Junfu, et autres
Publié: (2025)
Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?
par: Cheng, Junhao, et autres
Publié: (2025)
par: Cheng, Junhao, et autres
Publié: (2025)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
par: Xiao, Yicheng, et autres
Publié: (2025)
par: Xiao, Yicheng, et autres
Publié: (2025)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
par: Zhang, Jun, et autres
Publié: (2025)
par: Zhang, Jun, et autres
Publié: (2025)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
Supervised Fine-tuning in turn Improves Visual Foundation Models
par: Jiang, Xiaohu, et autres
Publié: (2024)
par: Jiang, Xiaohu, et autres
Publié: (2024)
ViT-Lens: Towards Omni-modal Representations
par: Lei, Weixian, et autres
Publié: (2023)
par: Lei, Weixian, et autres
Publié: (2023)
Moto: Latent Motion Token as the Bridging Language for Learning Robot Manipulation from Videos
par: Chen, Yi, et autres
Publié: (2024)
par: Chen, Yi, et autres
Publié: (2024)
DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA
par: Chen, Yi, et autres
Publié: (2026)
par: Chen, Yi, et autres
Publié: (2026)
HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding
par: Yang, Rui, et autres
Publié: (2025)
par: Yang, Rui, et autres
Publié: (2025)
YOLO-World: Real-Time Open-Vocabulary Object Detection
par: Cheng, Tianheng, et autres
Publié: (2024)
par: Cheng, Tianheng, et autres
Publié: (2024)
PUMA: Empowering Unified MLLM with Multi-granular Visual Generation
par: Fang, Rongyao, et autres
Publié: (2024)
par: Fang, Rongyao, et autres
Publié: (2024)
Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific Plots
par: Wu, Chengyue, et autres
Publié: (2024)
par: Wu, Chengyue, et autres
Publié: (2024)
ST-LLM: Large Language Models Are Effective Temporal Learners
par: Liu, Ruyang, et autres
Publié: (2024)
par: Liu, Ruyang, et autres
Publié: (2024)
ViT-Lens: Initiating Omni-Modal Exploration through 3D Insights
par: Lei, Weixian, et autres
Publié: (2023)
par: Lei, Weixian, et autres
Publié: (2023)
V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding
par: Ge, Junqi, et autres
Publié: (2024)
par: Ge, Junqi, et autres
Publié: (2024)
BT-Adapter: Video Conversation is Feasible Without Video Instruction Tuning
par: Liu, Ruyang, et autres
Publié: (2023)
par: Liu, Ruyang, et autres
Publié: (2023)
Meta-Adapter: An Online Few-shot Learner for Vision-Language Model
par: Cheng, Cheng, et autres
Publié: (2023)
par: Cheng, Cheng, et autres
Publié: (2023)
Towards Unified Multi-granularity Text Detection with Interactive Attention
par: Wan, Xingyu, et autres
Publié: (2024)
par: Wan, Xingyu, et autres
Publié: (2024)
Open-MAGVIT2: An Open-Source Project Toward Democratizing Auto-regressive Visual Generation
par: Luo, Zhuoyan, et autres
Publié: (2024)
par: Luo, Zhuoyan, et autres
Publié: (2024)
GrootVL: Tree Topology is All You Need in State Space Model
par: Xiao, Yicheng, et autres
Publié: (2024)
par: Xiao, Yicheng, et autres
Publié: (2024)
Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models
par: Zhou, Shengchao, et autres
Publié: (2025)
par: Zhou, Shengchao, et autres
Publié: (2025)
ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts
par: Ge, Yuying, et autres
Publié: (2025)
par: Ge, Yuying, et autres
Publié: (2025)
MotionVerse: A Unified Multimodal Framework for Motion Comprehension, Generation and Editing
par: Hou, Ruibing, et autres
Publié: (2025)
par: Hou, Ruibing, et autres
Publié: (2025)
Documents similaires
-
SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing
par: Ge, Yuying, et autres
Publié: (2024) -
SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension
par: Li, Bohao, et autres
Publié: (2024) -
SEED-Story: Multimodal Long Story Generation with Large Language Model
par: Yang, Shuai, et autres
Publié: (2024) -
Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation
par: Ge, Yuying, et autres
Publié: (2024) -
Exploring the Effect of Reinforcement Learning on Video Understanding: Insights from SEED-Bench-R1
par: Chen, Yi, et autres
Publié: (2025)