VARCO-VISION-2.0 Technical Report
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Cha, Young-rok, Ju, Jeongho, Park, SunYoung, Lee, Jong-Hyeon, Yu, Younghyun, Kim, Youngjune |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models
par: Ju, Jeongho, et autres
Publié: (2024)
par: Ju, Jeongho, et autres
Publié: (2024)
V-Agent: An Interactive Video Search System Using Vision-Language Models
par: Park, SunYoung, et autres
Publié: (2025)
par: Park, SunYoung, et autres
Publié: (2025)
Privacy-Aware Camera 2.0 Technical Report
par: Song, Huan, et autres
Publié: (2026)
par: Song, Huan, et autres
Publié: (2026)
DialogCC: An Automated Pipeline for Creating High-Quality Multi-Modal Dialogue Dataset
par: Lee, Young-Jun, et autres
Publié: (2022)
par: Lee, Young-Jun, et autres
Publié: (2022)
Pegasus-v1 Technical Report
par: Jung, Raehyuk, et autres
Publié: (2024)
par: Jung, Raehyuk, et autres
Publié: (2024)
Visually Dehallucinative Instruction Generation
par: Cha, Sungguk, et autres
Publié: (2024)
par: Cha, Sungguk, et autres
Publié: (2024)
Visual Question Answering Instruction: Unlocking Multimodal Large Language Model To Domain-Specific Visual Multitasks
par: Lee, Jusung, et autres
Publié: (2024)
par: Lee, Jusung, et autres
Publié: (2024)
Visually Dehallucinative Instruction Generation: Know What You Don't Know
par: Cha, Sungguk, et autres
Publié: (2024)
par: Cha, Sungguk, et autres
Publié: (2024)
Stark: Social Long-Term Multi-Modal Conversation with Persona Commonsense Knowledge
par: Lee, Young-Jun, et autres
Publié: (2024)
par: Lee, Young-Jun, et autres
Publié: (2024)
Mano Technical Report
par: Fu, Tianyu, et autres
Publié: (2025)
par: Fu, Tianyu, et autres
Publié: (2025)
PhysBrain 1.0 Technical Report
par: Lian, Shijie, et autres
Publié: (2026)
par: Lian, Shijie, et autres
Publié: (2026)
Large Language Models can Share Images, Too!
par: Lee, Young-Jun, et autres
Publié: (2023)
par: Lee, Young-Jun, et autres
Publié: (2023)
Arctic-Extract Technical Report
par: Chiliński, Mateusz, et autres
Publié: (2025)
par: Chiliński, Mateusz, et autres
Publié: (2025)
Skywork-R1V3 Technical Report
par: Shen, Wei, et autres
Publié: (2025)
par: Shen, Wei, et autres
Publié: (2025)
Docling Technical Report
par: Auer, Christoph, et autres
Publié: (2024)
par: Auer, Christoph, et autres
Publié: (2024)
Baichuan-Omni Technical Report
par: Li, Yadong, et autres
Publié: (2024)
par: Li, Yadong, et autres
Publié: (2024)
Leveraging the Power of MLLMs for Gloss-Free Sign Language Translation
par: Kim, Jungeun, et autres
Publié: (2024)
par: Kim, Jungeun, et autres
Publié: (2024)
Qwen2.5-VL Technical Report
par: Bai, Shuai, et autres
Publié: (2025)
par: Bai, Shuai, et autres
Publié: (2025)
Falcon2-11B Technical Report
par: Malartic, Quentin, et autres
Publié: (2024)
par: Malartic, Quentin, et autres
Publié: (2024)
Contrastive Language Prompting to Ease False Positives in Medical Anomaly Detection
par: Park, YeongHyeon, et autres
Publié: (2024)
par: Park, YeongHyeon, et autres
Publié: (2024)
SyncVSR: Data-Efficient Visual Speech Recognition with End-to-End Crossmodal Audio Token Synchronization
par: Ahn, Young Jin, et autres
Publié: (2024)
par: Ahn, Young Jin, et autres
Publié: (2024)
VisRAG 2.0: Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation
par: Sun, Yubo, et autres
Publié: (2025)
par: Sun, Yubo, et autres
Publié: (2025)
KlingAvatar 2.0 Technical Report
par: Kling Team, et autres
Publié: (2025)
par: Kling Team, et autres
Publié: (2025)
Intriguing Properties of Large Language and Vision Models
par: Lee, Young-Jun, et autres
Publié: (2024)
par: Lee, Young-Jun, et autres
Publié: (2024)
An Efficient Sign Language Translation Using Spatial Configuration and Motion Dynamics with LLMs
par: Hwang, Eui Jun, et autres
Publié: (2024)
par: Hwang, Eui Jun, et autres
Publié: (2024)
Qwen-Image-2.0 Technical Report
par: Zhao, Bing, et autres
Publié: (2026)
par: Zhao, Bing, et autres
Publié: (2026)
Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model
par: Ma, Guoqing, et autres
Publié: (2025)
par: Ma, Guoqing, et autres
Publié: (2025)
MedGemma Technical Report
par: Sellergren, Andrew, et autres
Publié: (2025)
par: Sellergren, Andrew, et autres
Publié: (2025)
LLMs Behind the Scenes: Enabling Narrative Scene Illustration
par: Roemmele, Melissa, et autres
Publié: (2025)
par: Roemmele, Melissa, et autres
Publié: (2025)
MATE: Meet At The Embedding -- Connecting Images with Long Texts
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
Multimodal Structured Generation: CVPR's 2nd MMFM Challenge Technical Report
par: Cesista, Franz Louis
Publié: (2024)
par: Cesista, Franz Louis
Publié: (2024)
Qwen-Image-VAE-2.0 Technical Report
par: Zhang, Zekai, et autres
Publié: (2026)
par: Zhang, Zekai, et autres
Publié: (2026)
A Spatio-Temporal Representation Learning as an Alternative to Traditional Glosses in Sign Language Translation and Production
par: Hwang, Eui Jun, et autres
Publié: (2024)
par: Hwang, Eui Jun, et autres
Publié: (2024)
Phoenix-VL 1.5 Medium Technical Report
par: Phoenix, Team, et autres
Publié: (2026)
par: Phoenix, Team, et autres
Publié: (2026)
Technical Report: Activation Residual Hessian Quantization (ARHQ) for Low-Bit LLM Quantization
par: Wang, YiFeng, et autres
Publié: (2026)
par: Wang, YiFeng, et autres
Publié: (2026)
Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model
par: Huang, Haoyang, et autres
Publié: (2025)
par: Huang, Haoyang, et autres
Publié: (2025)
Octopus v3: Technical Report for On-device Sub-billion Multimodal AI Agent
par: Chen, Wei, et autres
Publié: (2024)
par: Chen, Wei, et autres
Publié: (2024)
MiMo-Embodied: X-Embodied Foundation Model Technical Report
par: Hao, Xiaoshuai, et autres
Publié: (2025)
par: Hao, Xiaoshuai, et autres
Publié: (2025)
PTQ4VM: Post-Training Quantization for Visual Mamba
par: Cho, Younghyun, et autres
Publié: (2024)
par: Cho, Younghyun, et autres
Publié: (2024)
Draw Your Mind: Personalized Generation via Condition-Level Modeling in Text-to-Image Diffusion Models
par: Kim, Hyungjin, et autres
Publié: (2025)
par: Kim, Hyungjin, et autres
Publié: (2025)
Documents similaires
-
VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models
par: Ju, Jeongho, et autres
Publié: (2024) -
V-Agent: An Interactive Video Search System Using Vision-Language Models
par: Park, SunYoung, et autres
Publié: (2025) -
Privacy-Aware Camera 2.0 Technical Report
par: Song, Huan, et autres
Publié: (2026) -
DialogCC: An Automated Pipeline for Creating High-Quality Multi-Modal Dialogue Dataset
par: Lee, Young-Jun, et autres
Publié: (2022) -
Pegasus-v1 Technical Report
par: Jung, Raehyuk, et autres
Publié: (2024)