Skywork UniPic: Unified Autoregressive Modeling for Visual Understanding and Generation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Peiyu, Peng, Yi, Gan, Yimeng, Hu, Liang, Xie, Tianyidan, Wang, Xiaokun, Wei, Yichen, Tang, Chuanxin, Zhu, Bo, Li, Changshi, Wei, Hongyang, Li, Eric, Song, Xuchen, Liu, Yang, Zhou, Yahui |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
par: Wei, Hongyang, et autres
Publié: (2025)
par: Wei, Hongyang, et autres
Publié: (2025)
Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling
par: Wei, Hongyang, et autres
Publié: (2026)
par: Wei, Hongyang, et autres
Publié: (2026)
Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
par: Wang, Xiaokun, et autres
Publié: (2025)
par: Wang, Xiaokun, et autres
Publié: (2025)
Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning
par: Wang, Peiyu, et autres
Publié: (2025)
par: Wang, Peiyu, et autres
Publié: (2025)
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
par: Peng, Yi, et autres
Publié: (2025)
par: Peng, Yi, et autres
Publié: (2025)
Skywork-R1V4: Toward Agentic Multimodal Intelligence through Interleaved Thinking with Images and DeepResearch
par: Zhang, Yifan, et autres
Publié: (2025)
par: Zhang, Yifan, et autres
Publié: (2025)
Skywork-SWE: Unveiling Data Scaling Laws for Software Engineering in LLMs
par: Zeng, Liang, et autres
Publié: (2025)
par: Zeng, Liang, et autres
Publié: (2025)
Skywork-R1V3 Technical Report
par: Shen, Wei, et autres
Publié: (2025)
par: Shen, Wei, et autres
Publié: (2025)
LongSkywork: A Training Recipe for Efficiently Extending Context Length in Large Language Models
par: Zhao, Liang, et autres
Publié: (2024)
par: Zhao, Liang, et autres
Publié: (2024)
Skywork Open Reasoner 1 Technical Report
par: He, Jujie, et autres
Publié: (2025)
par: He, Jujie, et autres
Publié: (2025)
UniX: Unifying Autoregression and Diffusion for Chest X-Ray Understanding and Generation
par: Zhang, Ruiheng, et autres
Publié: (2026)
par: Zhang, Ruiheng, et autres
Publié: (2026)
Skywork-MoE: A Deep Dive into Training Techniques for Mixture-of-Experts Language Models
par: Wei, Tianwen, et autres
Publié: (2024)
par: Wei, Tianwen, et autres
Publié: (2024)
CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs
par: Jian, Ai, et autres
Publié: (2025)
par: Jian, Ai, et autres
Publié: (2025)
UniShield: Unified Face Attack Detection via KG-Informed Multimodal Reasoning
par: Li, Hongrui, et autres
Publié: (2026)
par: Li, Hongrui, et autres
Publié: (2026)
UniVL: Unified Vision-Language Embedding for Spatially Grounded Contextual Image Generation
par: Wang, Jiayun, et autres
Publié: (2026)
par: Wang, Jiayun, et autres
Publié: (2026)
UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation
par: Zhang, Chi, et autres
Publié: (2025)
par: Zhang, Chi, et autres
Publié: (2025)
Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
par: Liu, Chris Yuhao, et autres
Publié: (2024)
par: Liu, Chris Yuhao, et autres
Publié: (2024)
UniVBench: Towards Unified Evaluation for Video Foundation Models
par: Wei, Jianhui, et autres
Publié: (2026)
par: Wei, Jianhui, et autres
Publié: (2026)
Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better
par: Wang, Dianyi, et autres
Publié: (2025)
par: Wang, Dianyi, et autres
Publié: (2025)
UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation
par: Li, Yi, et autres
Publié: (2025)
par: Li, Yi, et autres
Publié: (2025)
Unified Medical Image Tokenizer for Autoregressive Synthesis and Understanding
par: Ma, Chenglong, et autres
Publié: (2025)
par: Ma, Chenglong, et autres
Publié: (2025)
UniVideo: Unified Understanding, Generation, and Editing for Videos
par: Wei, Cong, et autres
Publié: (2025)
par: Wei, Cong, et autres
Publié: (2025)
Unified Autoregressive Visual Generation and Understanding with Continuous Tokens
par: Fan, Lijie, et autres
Publié: (2025)
par: Fan, Lijie, et autres
Publié: (2025)
UniT: Unified Geometry Learning with Group Autoregressive Transformer
par: Wang, Haotian, et autres
Publié: (2026)
par: Wang, Haotian, et autres
Publié: (2026)
UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models
par: Guan, Wenhao, et autres
Publié: (2025)
par: Guan, Wenhao, et autres
Publié: (2025)
UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment
par: Xie, Hongyan, et autres
Publié: (2026)
par: Xie, Hongyan, et autres
Publié: (2026)
UniFlow: A Unified Pixel Flow Tokenizer for Visual Understanding and Generation
par: Yue, Zhengrong, et autres
Publié: (2025)
par: Yue, Zhengrong, et autres
Publié: (2025)
Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy
par: Liu, Chris Yuhao, et autres
Publié: (2025)
par: Liu, Chris Yuhao, et autres
Publié: (2025)
OpenUni: A Simple Baseline for Unified Multimodal Understanding and Generation
par: Wu, Size, et autres
Publié: (2025)
par: Wu, Size, et autres
Publié: (2025)
UniECG: Understanding and Generating ECG in One Unified Model
par: Jin, Jiarui, et autres
Publié: (2025)
par: Jin, Jiarui, et autres
Publié: (2025)
UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing
par: Tang, Hao, et autres
Publié: (2025)
par: Tang, Hao, et autres
Publié: (2025)
UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation
par: Lin, Bin, et autres
Publié: (2025)
par: Lin, Bin, et autres
Publié: (2025)
Perceive, Understand and Restore: Real-World Image Super-Resolution with Autoregressive Multimodal Generative Models
par: Wei, Hongyang, et autres
Publié: (2025)
par: Wei, Hongyang, et autres
Publié: (2025)
Skywork-Math: Data Scaling Laws for Mathematical Reasoning in Large Language Models -- The Story Goes On
par: Zeng, Liang, et autres
Publié: (2024)
par: Zeng, Liang, et autres
Publié: (2024)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
par: Ma, Chuofan, et autres
Publié: (2025)
par: Ma, Chuofan, et autres
Publié: (2025)
UniMo: Unified Motion Generation and Understanding with Chain of Thought
par: Wang, Guocun, et autres
Publié: (2026)
par: Wang, Guocun, et autres
Publié: (2026)
UniCompress: Token Compression for Unified Vision-Language Understanding and Generation
par: Wang, Ziyao, et autres
Publié: (2026)
par: Wang, Ziyao, et autres
Publié: (2026)
UniFormer: Unifying Convolution and Self-attention for Visual Recognition
par: Li, Kunchang, et autres
Publié: (2022)
par: Li, Kunchang, et autres
Publié: (2022)
UniQueR: Unified Query-based Feedforward 3D Reconstruction
par: Peng, Chensheng, et autres
Publié: (2026)
par: Peng, Chensheng, et autres
Publié: (2026)
UniSVG: A Unified Dataset for Vector Graphic Understanding and Generation with Multimodal Large Language Models
par: Li, Jinke, et autres
Publié: (2025)
par: Li, Jinke, et autres
Publié: (2025)
Documents similaires
-
Skywork UniPic 2.0: Building Kontext Model with Online RL for Unified Multimodal Model
par: Wei, Hongyang, et autres
Publié: (2025) -
Skywork UniPic 3.0: Unified Multi-Image Composition via Sequence Modeling
par: Wei, Hongyang, et autres
Publié: (2026) -
Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning
par: Wang, Xiaokun, et autres
Publié: (2025) -
Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning
par: Wang, Peiyu, et autres
Publié: (2025) -
Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought
par: Peng, Yi, et autres
Publié: (2025)