Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring
Fuente:
arXiv
Saved in:
| Main Authors: | Zhan, Yufei, Zheng, Shurong, Zhu, Yousong, Zhao, Hongyin, Yang, Fan, Tang, Ming, Wang, Jinqiao |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
by: Zhan, Yufei, et al.
Published: (2024)
by: Zhan, Yufei, et al.
Published: (2024)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
by: Zhan, Yufei, et al.
Published: (2025)
by: Zhan, Yufei, et al.
Published: (2025)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
by: Zheng, Shurong, et al.
Published: (2026)
by: Zheng, Shurong, et al.
Published: (2026)
Griffon: Spelling out All Object Locations at Any Granularity with Large Language Models
by: Zhan, Yufei, et al.
Published: (2023)
by: Zhan, Yufei, et al.
Published: (2023)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
by: Zhan, Yufei, et al.
Published: (2025)
by: Zhan, Yufei, et al.
Published: (2025)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
by: Yang, Fan, et al.
Published: (2026)
by: Yang, Fan, et al.
Published: (2026)
FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
by: Yang, Fan, et al.
Published: (2025)
by: Yang, Fan, et al.
Published: (2025)
VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?
by: Yu, Jiachen, et al.
Published: (2025)
by: Yu, Jiachen, et al.
Published: (2025)
From Seeing to Predicting: A Vision-Language Framework for Trajectory Forecasting and Controlled Video Generation
by: Yang, Fan, et al.
Published: (2025)
by: Yang, Fan, et al.
Published: (2025)
GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
by: Zhan, Yufei, et al.
Published: (2025)
by: Zhan, Yufei, et al.
Published: (2025)
Efficient Masked Autoencoders with Self-Consistency
by: Li, Zhaowen, et al.
Published: (2023)
by: Li, Zhaowen, et al.
Published: (2023)
MROVSeg: Breaking the Resolution Curse of Vision-Language Models in Open-Vocabulary Image Segmentation
by: Zhu, Yuanbing, et al.
Published: (2024)
by: Zhu, Yuanbing, et al.
Published: (2024)
Unifying Ontology Construction and Semantic Alignment for Deterministic Enterprise Reasoning at Scale
by: Zhu, Hongyin
Published: (2026)
by: Zhu, Hongyin
Published: (2026)
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
by: Zhou, Weijie, et al.
Published: (2025)
by: Zhou, Weijie, et al.
Published: (2025)
Challenges and Responses in the Practice of Large Language Models
by: Zhu, Hongyin
Published: (2024)
by: Zhu, Hongyin
Published: (2024)
Architectural Foundations for the Large Language Model Infrastructures
by: Zhu, Hongyin
Published: (2024)
by: Zhu, Hongyin
Published: (2024)
Movements of restocked Griffon Vultures in Sardinia
by: Guilherme, João, et al.
Published: (2025)
by: Guilherme, João, et al.
Published: (2025)
Unleashing Perception-Time Scaling to Multimodal Reasoning Models
by: Li, Yifan, et al.
Published: (2025)
by: Li, Yifan, et al.
Published: (2025)
Survival Remains High in Griffon Vultures 40 Years After Reintroduction
by: Charlotte Lorand, et al.
Published: (2025)
by: Charlotte Lorand, et al.
Published: (2025)
Harmonizing Human Insights and AI Precision: Hand in Hand for Advancing Knowledge Graph Task
by: Wang, Shurong, et al.
Published: (2024)
by: Wang, Shurong, et al.
Published: (2024)
Systematic Outliers in Large Language Models
by: An, Yongqi, et al.
Published: (2025)
by: An, Yongqi, et al.
Published: (2025)
AnomalyMoE: Towards a Language-free Generalist Model for Unified Visual Anomaly Detection
by: Gu, Zhaopeng, et al.
Published: (2025)
by: Gu, Zhaopeng, et al.
Published: (2025)
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability
by: Zhou, Weijie, et al.
Published: (2025)
by: Zhou, Weijie, et al.
Published: (2025)
MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
by: Wang, Langyu, et al.
Published: (2025)
by: Wang, Langyu, et al.
Published: (2025)
UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly Detection
by: Gu, Zhaopeng, et al.
Published: (2024)
by: Gu, Zhaopeng, et al.
Published: (2024)
SEEKR: Selective Attention-Guided Knowledge Retention for Continual Learning of Large Language Models
by: He, Jinghan, et al.
Published: (2024)
by: He, Jinghan, et al.
Published: (2024)
CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception
by: Li, Liupeng, et al.
Published: (2026)
by: Li, Liupeng, et al.
Published: (2026)
Climate Change from Large Language Models
by: Zhu, Hongyin, et al.
Published: (2023)
by: Zhu, Hongyin, et al.
Published: (2023)
Quality-Aware Language-Conditioned Local Auto-Regressive Anomaly Synthesis and Detection
by: Qian, Long, et al.
Published: (2025)
by: Qian, Long, et al.
Published: (2025)
Reranking Passages with Coarse-to-Fine Neural Retriever Enhanced by List-Context Information
by: Zhu, Hongyin
Published: (2023)
by: Zhu, Hongyin
Published: (2023)
Node Classification via Semantic-Structural Attention-Enhanced Graph Convolutional Networks
by: Zhu, Hongyin
Published: (2024)
by: Zhu, Hongyin
Published: (2024)
Industry Risk Assessment via Hierarchical Financial Data Using Stock Market Sentiment Indicators
by: Zhu, Hongyin
Published: (2023)
by: Zhu, Hongyin
Published: (2023)
VisualRWKV-HD and UHD: Advancing High-Resolution Processing for Visual Language Models
by: Li, Zihang, et al.
Published: (2024)
by: Li, Zihang, et al.
Published: (2024)
Bilateral Reference for High-Resolution Dichotomous Image Segmentation
by: Zheng, Peng, et al.
Published: (2024)
by: Zheng, Peng, et al.
Published: (2024)
Referring Expression Instance Retrieval and A Strong End-to-End Baseline
by: Hao, Xiangzhao, et al.
Published: (2025)
by: Hao, Xiangzhao, et al.
Published: (2025)
Annotation-Free Visual Reasoning for High-Resolution Large Multimodal Models via Reinforcement Learning
by: Yang, Jiacheng, et al.
Published: (2026)
by: Yang, Jiacheng, et al.
Published: (2026)
Understanding the Impact of Referent Design on Scale Perception in Immersive Data Visualization
by: Hou, Yihan, et al.
Published: (2024)
by: Hou, Yihan, et al.
Published: (2024)
Retrieval-Augmented Perception: High-Resolution Image Perception Meets Visual RAG
by: Wang, Wenbin, et al.
Published: (2025)
by: Wang, Wenbin, et al.
Published: (2025)
Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models
by: Zhang, Enming, et al.
Published: (2024)
by: Zhang, Enming, et al.
Published: (2024)
INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model
by: Ma, Yiwei, et al.
Published: (2024)
by: Ma, Yiwei, et al.
Published: (2024)
Similar Items
-
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
by: Zhan, Yufei, et al.
Published: (2024) -
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
by: Zhan, Yufei, et al.
Published: (2025) -
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
by: Zheng, Shurong, et al.
Published: (2026) -
Griffon: Spelling out All Object Locations at Any Granularity with Large Language Models
by: Zhan, Yufei, et al.
Published: (2023) -
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
by: Zhan, Yufei, et al.
Published: (2025)