Griffon: Spelling out All Object Locations at Any Granularity with Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Zhan, Yufei, Zhu, Yousong, Chen, Zhiyang, Yang, Fan, Tang, Ming, Wang, Jinqiao |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2023
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
di: Zhan, Yufei, et al.
Pubblicazione: (2024)
di: Zhan, Yufei, et al.
Pubblicazione: (2024)
Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring
di: Zhan, Yufei, et al.
Pubblicazione: (2024)
di: Zhan, Yufei, et al.
Pubblicazione: (2024)
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
di: Zheng, Shurong, et al.
Pubblicazione: (2026)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
From Seeing to Predicting: A Vision-Language Framework for Trajectory Forecasting and Controlled Video Generation
di: Yang, Fan, et al.
Pubblicazione: (2025)
di: Yang, Fan, et al.
Pubblicazione: (2025)
FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
di: Yang, Fan, et al.
Pubblicazione: (2025)
di: Yang, Fan, et al.
Pubblicazione: (2025)
TraceVision: Trajectory-Aware Vision-Language Model for Human-Like Spatial Understanding
di: Yang, Fan, et al.
Pubblicazione: (2026)
di: Yang, Fan, et al.
Pubblicazione: (2026)
VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?
di: Yu, Jiachen, et al.
Pubblicazione: (2025)
di: Yu, Jiachen, et al.
Pubblicazione: (2025)
Efficient Masked Autoencoders with Self-Consistency
di: Li, Zhaowen, et al.
Pubblicazione: (2023)
di: Li, Zhaowen, et al.
Pubblicazione: (2023)
GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
Optimization of Prompt Learning via Multi-Knowledge Representation for Vision-Language Models
di: Zhang, Enming, et al.
Pubblicazione: (2024)
di: Zhang, Enming, et al.
Pubblicazione: (2024)
Quality-Aware Language-Conditioned Local Auto-Regressive Anomaly Synthesis and Detection
di: Qian, Long, et al.
Pubblicazione: (2025)
di: Qian, Long, et al.
Pubblicazione: (2025)
Count Anything at Any Granularity
di: Liu, Chang, et al.
Pubblicazione: (2026)
di: Liu, Chang, et al.
Pubblicazione: (2026)
Track Any Anomalous Object: A Granular Video Anomaly Detection Pipeline
di: Huang, Yuzhi, et al.
Pubblicazione: (2025)
di: Huang, Yuzhi, et al.
Pubblicazione: (2025)
AnomalyMoE: Towards a Language-free Generalist Model for Unified Visual Anomaly Detection
di: Gu, Zhaopeng, et al.
Pubblicazione: (2025)
di: Gu, Zhaopeng, et al.
Pubblicazione: (2025)
MROVSeg: Breaking the Resolution Curse of Vision-Language Models in Open-Vocabulary Image Segmentation
di: Zhu, Yuanbing, et al.
Pubblicazione: (2024)
di: Zhu, Yuanbing, et al.
Pubblicazione: (2024)
SAM 2++: Tracking Anything at Any Granularity
di: Zhang, Jiaming, et al.
Pubblicazione: (2025)
di: Zhang, Jiaming, et al.
Pubblicazione: (2025)
Articulate AnyMesh: Open-Vocabulary 3D Articulated Objects Modeling
di: Qiu, Xiaowen, et al.
Pubblicazione: (2025)
di: Qiu, Xiaowen, et al.
Pubblicazione: (2025)
UniVAD: A Training-free Unified Model for Few-shot Visual Anomaly Detection
di: Gu, Zhaopeng, et al.
Pubblicazione: (2024)
di: Gu, Zhaopeng, et al.
Pubblicazione: (2024)
MathPhys-Guided Coarse-to-Fine Anomaly Synthesis with SQE-Driven Bi-Level Optimization for Anomaly Detection
di: Qian, Long, et al.
Pubblicazione: (2025)
di: Qian, Long, et al.
Pubblicazione: (2025)
PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
di: Zhou, Weijie, et al.
Pubblicazione: (2025)
di: Zhou, Weijie, et al.
Pubblicazione: (2025)
Point Linguist Model: Segment Any Object via Bridged Large 3D-Language Model
di: Huang, Zhuoxu, et al.
Pubblicazione: (2025)
di: Huang, Zhuoxu, et al.
Pubblicazione: (2025)
Multi-Granularity Language-Guided Training for Multi-Object Tracking
di: Li, Yuhao, et al.
Pubblicazione: (2024)
di: Li, Yuhao, et al.
Pubblicazione: (2024)
Decoupled Similarity for Task-Aware Token Pruning in Large Vision-Language Models
di: Ma, Kexin, et al.
Pubblicazione: (2026)
di: Ma, Kexin, et al.
Pubblicazione: (2026)
FiLo++: Zero-/Few-Shot Anomaly Detection by Fused Fine-Grained Descriptions and Deformable Localization
di: Gu, Zhaopeng, et al.
Pubblicazione: (2025)
di: Gu, Zhaopeng, et al.
Pubblicazione: (2025)
AniSDF: Fused-Granularity Neural Surfaces with Anisotropic Encoding for High-Fidelity 3D Reconstruction
di: Gao, Jingnan, et al.
Pubblicazione: (2024)
di: Gao, Jingnan, et al.
Pubblicazione: (2024)
Deep Models, Shallow Alignment: Uncovering the Granularity Mismatch in Neural Decoding
di: Du, Yang, et al.
Pubblicazione: (2026)
di: Du, Yang, et al.
Pubblicazione: (2026)
One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception
di: Li, Yang, et al.
Pubblicazione: (2026)
di: Li, Yang, et al.
Pubblicazione: (2026)
AnyTrans: Translate AnyText in the Image with Large Scale Models
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
di: Qian, Zhipeng, et al.
Pubblicazione: (2024)
MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing
di: Wang, Langyu, et al.
Pubblicazione: (2025)
di: Wang, Langyu, et al.
Pubblicazione: (2025)
Vision Language Models Are Not (Yet) Spelling Correctors
di: Liang, Junhong, et al.
Pubblicazione: (2025)
di: Liang, Junhong, et al.
Pubblicazione: (2025)
SegmentAnyBone: A Universal Model that Segments Any Bone at Any Location on MRI
di: Gu, Hanxue, et al.
Pubblicazione: (2024)
di: Gu, Hanxue, et al.
Pubblicazione: (2024)
A Benchmark for Crime Surveillance Video Analysis with Large Models
di: Chen, Haoran, et al.
Pubblicazione: (2025)
di: Chen, Haoran, et al.
Pubblicazione: (2025)
Universal Segmentation at Arbitrary Granularity with Language Instruction
di: Liu, Yong, et al.
Pubblicazione: (2023)
di: Liu, Yong, et al.
Pubblicazione: (2023)
4D-LRM: Large Space-Time Reconstruction Model From and To Any View at Any Time
di: Ma, Ziqiao, et al.
Pubblicazione: (2025)
di: Ma, Ziqiao, et al.
Pubblicazione: (2025)
PixCLIP: Achieving Fine-grained Visual Language Understanding via Any-granularity Pixel-Text Alignment Learning
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
di: Xiao, Yicheng, et al.
Pubblicazione: (2025)
Distraction is All You Need for Multimodal Large Language Model Jailbreaking
di: Yang, Zuopeng, et al.
Pubblicazione: (2025)
di: Yang, Zuopeng, et al.
Pubblicazione: (2025)
Single-Model and Any-Modality for Video Object Tracking
di: Wu, Zongwei, et al.
Pubblicazione: (2023)
di: Wu, Zongwei, et al.
Pubblicazione: (2023)
PhysVLM: Enabling Visual Language Models to Understand Robotic Physical Reachability
di: Zhou, Weijie, et al.
Pubblicazione: (2025)
di: Zhou, Weijie, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Griffon-G: Bridging Vision-Language and Vision-Centric Tasks via Large Multimodal Models
di: Zhan, Yufei, et al.
Pubblicazione: (2024) -
Griffon v2: Advancing Multimodal Perception with High-Resolution Scaling and Visual-Language Co-Referring
di: Zhan, Yufei, et al.
Pubblicazione: (2024) -
GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models
di: Zheng, Shurong, et al.
Pubblicazione: (2026) -
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
di: Zhan, Yufei, et al.
Pubblicazione: (2025) -
Understand, Think, and Answer: Advancing Visual Reasoning with Large Multimodal Models
di: Zhan, Yufei, et al.
Pubblicazione: (2025)