Ovis-Image Technical Report
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Wang, Guo-Hua, Cao, Liangfu, Cui, Tianyu, Fu, Minghao, Chen, Xiaohao, Zhan, Pengxin, Zhao, Jianshan, Li, Lan, Fu, Bowen, Liu, Jiaqi, Chen, Qing-Guo |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Ovis-U1 Technical Report
von: Wang, Guo-Hua, et al.
Veröffentlicht: (2025)
von: Wang, Guo-Hua, et al.
Veröffentlicht: (2025)
CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation
von: Fu, Minghao, et al.
Veröffentlicht: (2025)
von: Fu, Minghao, et al.
Veröffentlicht: (2025)
TeEFusion: Blending Text Embeddings to Distill Classifier-Free Guidance
von: Fu, Minghao, et al.
Veröffentlicht: (2025)
von: Fu, Minghao, et al.
Veröffentlicht: (2025)
Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
von: Fu, Minghao, et al.
Veröffentlicht: (2025)
von: Fu, Minghao, et al.
Veröffentlicht: (2025)
Ovis2.5 Technical Report
von: Lu, Shiyin, et al.
Veröffentlicht: (2025)
von: Lu, Shiyin, et al.
Veröffentlicht: (2025)
Evaluating Image Caption via Cycle-consistent Text-to-Image Generation
von: Cui, Tianyu, et al.
Veröffentlicht: (2025)
von: Cui, Tianyu, et al.
Veröffentlicht: (2025)
iMedImage Technical Report
von: Wei, Ran, et al.
Veröffentlicht: (2025)
von: Wei, Ran, et al.
Veröffentlicht: (2025)
Qwen-Image Technical Report
von: Wu, Chenfei, et al.
Veröffentlicht: (2025)
von: Wu, Chenfei, et al.
Veröffentlicht: (2025)
EmoAttack: Emotion-to-Image Diffusion Models for Emotional Backdoor Generation
von: Wei, Tianyu, et al.
Veröffentlicht: (2024)
von: Wei, Tianyu, et al.
Veröffentlicht: (2024)
Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities
von: Zhao, Shanshan, et al.
Veröffentlicht: (2025)
von: Zhao, Shanshan, et al.
Veröffentlicht: (2025)
Images Speak Louder Than Scores: Failure Mode Escape for Enhancing Generative Quality
von: Shao, Jie, et al.
Veröffentlicht: (2025)
von: Shao, Jie, et al.
Veröffentlicht: (2025)
Technical Report for ActivityNet Challenge 2022 -- Temporal Action Localization
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
Technical Report for SoccerNet Challenge 2022 -- Replay Grounding Task
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
von: Chen, Shimin, et al.
Veröffentlicht: (2024)
BooW-VTON: Boosting In-the-Wild Virtual Try-On via Mask-Free Pseudo Data Training
von: Zhang, Xuanpu, et al.
Veröffentlicht: (2024)
von: Zhang, Xuanpu, et al.
Veröffentlicht: (2024)
Ovis: Structural Embedding Alignment for Multimodal Large Language Model
von: Lu, Shiyin, et al.
Veröffentlicht: (2024)
von: Lu, Shiyin, et al.
Veröffentlicht: (2024)
PEMF-VTO: Point-Enhanced Video Virtual Try-on via Mask-free Paradigm
von: Chang, Tianyu, et al.
Veröffentlicht: (2024)
von: Chang, Tianyu, et al.
Veröffentlicht: (2024)
Qwen-Image-2.0 Technical Report
von: Zhao, Bing, et al.
Veröffentlicht: (2026)
von: Zhao, Bing, et al.
Veröffentlicht: (2026)
Rectify the Regression Bias in Long-Tailed Object Detection
von: Zhu, Ke, et al.
Veröffentlicht: (2024)
von: Zhu, Ke, et al.
Veröffentlicht: (2024)
Diff-CXR: Report-to-CXR generation through a disease-knowledge enhanced diffusion model
von: Huang, Peng, et al.
Veröffentlicht: (2024)
von: Huang, Peng, et al.
Veröffentlicht: (2024)
AnchorRoute: Human Motion Synthesis with Interval-Routed Sparse Contro
von: Fang, Pengcheng, et al.
Veröffentlicht: (2026)
von: Fang, Pengcheng, et al.
Veröffentlicht: (2026)
VAP-Diffusion: Enriching Descriptions with MLLMs for Enhanced Medical Image Generation
von: Huang, Peng, et al.
Veröffentlicht: (2025)
von: Huang, Peng, et al.
Veröffentlicht: (2025)
HunyuanImage 3.0 Technical Report
von: Cao, Siyu, et al.
Veröffentlicht: (2025)
von: Cao, Siyu, et al.
Veröffentlicht: (2025)
UI-Venus Technical Report: Building High-performance UI Agents with RFT
von: Gu, Zhangxuan, et al.
Veröffentlicht: (2025)
von: Gu, Zhangxuan, et al.
Veröffentlicht: (2025)
Qwen-Image-VAE-2.0 Technical Report
von: Zhang, Zekai, et al.
Veröffentlicht: (2026)
von: Zhang, Zekai, et al.
Veröffentlicht: (2026)
ERNIE-Image Technical Report
von: Liu, Jiaxiang, et al.
Veröffentlicht: (2026)
von: Liu, Jiaxiang, et al.
Veröffentlicht: (2026)
SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing
von: Ge, Yuying, et al.
Veröffentlicht: (2024)
von: Ge, Yuying, et al.
Veröffentlicht: (2024)
Mano Technical Report
von: Fu, Tianyu, et al.
Veröffentlicht: (2025)
von: Fu, Tianyu, et al.
Veröffentlicht: (2025)
LandMarkSystem Technical Report
von: Ma, Zhenxiang, et al.
Veröffentlicht: (2025)
von: Ma, Zhenxiang, et al.
Veröffentlicht: (2025)
Better Fit: Accommodate Variations in Clothing Types for Virtual Try-on
von: Song, Dan, et al.
Veröffentlicht: (2024)
von: Song, Dan, et al.
Veröffentlicht: (2024)
UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars
von: Zhan, Xiaoyu, et al.
Veröffentlicht: (2026)
von: Zhan, Xiaoyu, et al.
Veröffentlicht: (2026)
Xiaomi MiMo-VL-Miloco Technical Report
von: Li, Jiaze, et al.
Veröffentlicht: (2025)
von: Li, Jiaze, et al.
Veröffentlicht: (2025)
ODM: A Text-Image Further Alignment Pre-training Approach for Scene Text Detection and Spotting
von: Duan, Chen, et al.
Veröffentlicht: (2024)
von: Duan, Chen, et al.
Veröffentlicht: (2024)
Kimi-VL Technical Report
von: Kimi Team, et al.
Veröffentlicht: (2025)
von: Kimi Team, et al.
Veröffentlicht: (2025)
StreamingClaw Technical Report
von: Chen, Jiawei, et al.
Veröffentlicht: (2026)
von: Chen, Jiawei, et al.
Veröffentlicht: (2026)
LongCat-Image Technical Report
von: Meituan LongCat Team, et al.
Veröffentlicht: (2025)
von: Meituan LongCat Team, et al.
Veröffentlicht: (2025)
Minimal Interaction Separated Tuning: A New Paradigm for Visual Adaptation
von: Tang, Ningyuan, et al.
Veröffentlicht: (2024)
von: Tang, Ningyuan, et al.
Veröffentlicht: (2024)
MASSeg : 2nd Technical Report for 4th PVUW MOSE Track
von: Cao, Xuqiang, et al.
Veröffentlicht: (2025)
von: Cao, Xuqiang, et al.
Veröffentlicht: (2025)
Logics-Parsing Technical Report
von: Chen, Xiangyang, et al.
Veröffentlicht: (2025)
von: Chen, Xiangyang, et al.
Veröffentlicht: (2025)
FireRed-Image-Edit-1.0 Technical Report
von: Super Intelligence Team, et al.
Veröffentlicht: (2026)
von: Super Intelligence Team, et al.
Veröffentlicht: (2026)
Aggregated Contextual Transformations for High-Resolution Image Inpainting
von: Zeng, Yanhong, et al.
Veröffentlicht: (2021)
von: Zeng, Yanhong, et al.
Veröffentlicht: (2021)
Ähnliche Einträge
-
Ovis-U1 Technical Report
von: Wang, Guo-Hua, et al.
Veröffentlicht: (2025) -
CHATS: Combining Human-Aligned Optimization and Test-Time Sampling for Text-to-Image Generation
von: Fu, Minghao, et al.
Veröffentlicht: (2025) -
TeEFusion: Blending Text Embeddings to Distill Classifier-Free Guidance
von: Fu, Minghao, et al.
Veröffentlicht: (2025) -
Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models
von: Fu, Minghao, et al.
Veröffentlicht: (2025) -
Ovis2.5 Technical Report
von: Lu, Shiyin, et al.
Veröffentlicht: (2025)