PLaMo 2.1-VL Technical Report
Fuente:
arXiv
Guardado en:
| Autores principales: | Kerola, Tommi, Masuda, Yuya, Masuko, Takashi, Nakanishi, Toshiki, Nishino, Daisuke, Takahashi, Kuniyuki, Wang, Hanqin, Yamada, Yoshihiro |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
PLaMo 2 Technical Report
por: Networks, Preferred, et al.
Publicado: (2025)
por: Networks, Preferred, et al.
Publicado: (2025)
Xiaomi MiMo-VL-Miloco Technical Report
por: Li, Jiaze, et al.
Publicado: (2025)
por: Li, Jiaze, et al.
Publicado: (2025)
Singpath-VL Technical Report
por: Qiu, Zhen, et al.
Publicado: (2026)
por: Qiu, Zhen, et al.
Publicado: (2026)
Kimi-VL Technical Report
por: Kimi Team, et al.
Publicado: (2025)
por: Kimi Team, et al.
Publicado: (2025)
Kwai Keye-VL Technical Report
por: Kwai Keye Team, et al.
Publicado: (2025)
por: Kwai Keye Team, et al.
Publicado: (2025)
SAIL-VL2 Technical Report
por: Yin, Weijie, et al.
Publicado: (2025)
por: Yin, Weijie, et al.
Publicado: (2025)
PLaMo-100B: A Ground-Up Language Model Designed for Japanese Proficiency
por: Elements, Preferred, et al.
Publicado: (2024)
por: Elements, Preferred, et al.
Publicado: (2024)
Qwen3-VL Technical Report
por: Bai, Shuai, et al.
Publicado: (2025)
por: Bai, Shuai, et al.
Publicado: (2025)
STEP3-VL-10B Technical Report
por: Huang, Ailin, et al.
Publicado: (2026)
por: Huang, Ailin, et al.
Publicado: (2026)
Kwai Keye-VL 1.5 Technical Report
por: Yang, Biao, et al.
Publicado: (2025)
por: Yang, Biao, et al.
Publicado: (2025)
Qwen2.5-VL Technical Report
por: Bai, Shuai, et al.
Publicado: (2025)
por: Bai, Shuai, et al.
Publicado: (2025)
Seed1.5-VL Technical Report
por: Guo, Dong, et al.
Publicado: (2025)
por: Guo, Dong, et al.
Publicado: (2025)
ZAYA1-VL-8B Technical Report
por: Shapourian, Hassan, et al.
Publicado: (2026)
por: Shapourian, Hassan, et al.
Publicado: (2026)
SAID-NeRF: Segmentation-AIDed NeRF for Depth Completion of Transparent Objects
por: Ummadisingu, Avinash, et al.
Publicado: (2024)
por: Ummadisingu, Avinash, et al.
Publicado: (2024)
Phoenix-VL 1.5 Medium Technical Report
por: Phoenix, Team, et al.
Publicado: (2026)
por: Phoenix, Team, et al.
Publicado: (2026)
AndesVL Technical Report: An Efficient Mobile-side Multimodal Large Language Model
por: Jin, Zhiwei, et al.
Publicado: (2025)
por: Jin, Zhiwei, et al.
Publicado: (2025)
CAT: Circular-Convolutional Attention for Sub-Quadratic Transformers
por: Yamada, Yoshihiro
Publicado: (2025)
por: Yamada, Yoshihiro
Publicado: (2025)
Person-In-Situ: Scene-Consistent Human Image Insertion with Occlusion-Aware Pose Control
por: Masuda, Shun, et al.
Publicado: (2025)
por: Masuda, Shun, et al.
Publicado: (2025)
TerraFusion: Joint Generation of Terrain Geometry and Texture Using Latent Diffusion Models
por: Higo, Kazuki, et al.
Publicado: (2025)
por: Higo, Kazuki, et al.
Publicado: (2025)
J-EDI QA: Benchmark for deep-sea organism-specific multimodal LLM
por: Yoshida, Takero, et al.
Publicado: (2024)
por: Yoshida, Takero, et al.
Publicado: (2024)
Kelix Technical Report
por: Ding, Boyang, et al.
Publicado: (2026)
por: Ding, Boyang, et al.
Publicado: (2026)
Quantifying Cancer Likeness: A Statistical Approach for Pathological Image Diagnosis
por: Kindo, Toshiki
Publicado: (2024)
por: Kindo, Toshiki
Publicado: (2024)
MiMo-Embodied: X-Embodied Foundation Model Technical Report
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
por: Hao, Xiaoshuai, et al.
Publicado: (2025)
VEN-VL: A Visual Ensemble MoE Framework for Effective and Efficient Multi-Modal Understanding
por: Wu, Yinghao, et al.
Publicado: (2026)
por: Wu, Yinghao, et al.
Publicado: (2026)
MoVL:Exploring Fusion Strategies for the Domain-Adaptive Application of Pretrained Models in Medical Imaging Tasks
por: Tian, Haijiang, et al.
Publicado: (2024)
por: Tian, Haijiang, et al.
Publicado: (2024)
MoLA: Motion Generation and Editing with Latent Diffusion Enhanced by Adversarial Training
por: Uchida, Kengo, et al.
Publicado: (2024)
por: Uchida, Kengo, et al.
Publicado: (2024)
StreamingClaw Technical Report
por: Chen, Jiawei, et al.
Publicado: (2026)
por: Chen, Jiawei, et al.
Publicado: (2026)
Uni-Parser Technical Report
por: Fang, Xi, et al.
Publicado: (2025)
por: Fang, Xi, et al.
Publicado: (2025)
Step-GUI Technical Report
por: Yan, Haolong, et al.
Publicado: (2025)
por: Yan, Haolong, et al.
Publicado: (2025)
Logics-Parsing Technical Report
por: Chen, Xiangyang, et al.
Publicado: (2025)
por: Chen, Xiangyang, et al.
Publicado: (2025)
ABot-OCR Technical Report
por: Jiang, Kaitao, et al.
Publicado: (2026)
por: Jiang, Kaitao, et al.
Publicado: (2026)
NeuroClaw Technical Report
por: Wang, Cheng, et al.
Publicado: (2026)
por: Wang, Cheng, et al.
Publicado: (2026)
Qwen-Image Technical Report
por: Wu, Chenfei, et al.
Publicado: (2025)
por: Wu, Chenfei, et al.
Publicado: (2025)
Kling-Omni Technical Report
por: Kling Team, et al.
Publicado: (2025)
por: Kling Team, et al.
Publicado: (2025)
InternVL-X: Advancing and Accelerating InternVL Series with Efficient Visual Token Compression
por: Lu, Dongchen, et al.
Publicado: (2025)
por: Lu, Dongchen, et al.
Publicado: (2025)
LandMarkSystem Technical Report
por: Ma, Zhenxiang, et al.
Publicado: (2025)
por: Ma, Zhenxiang, et al.
Publicado: (2025)
Ejemplares similares
-
PLaMo 2 Technical Report
por: Networks, Preferred, et al.
Publicado: (2025) -
Xiaomi MiMo-VL-Miloco Technical Report
por: Li, Jiaze, et al.
Publicado: (2025) -
Singpath-VL Technical Report
por: Qiu, Zhen, et al.
Publicado: (2026) -
Kimi-VL Technical Report
por: Kimi Team, et al.
Publicado: (2025) -
Kwai Keye-VL Technical Report
por: Kwai Keye Team, et al.
Publicado: (2025)