LaSagnA: Language-based Segmentation Assistant for Complex Queries
Fuente:
arXiv
Salvato in:
| Autori principali: | Wei, Cong, Tan, Haoxian, Zhong, Yujie, Yang, Yujiu, Ma, Lin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
HyperSeg: Towards Universal Visual Segmentation with Large Language Model
di: Wei, Cong, et al.
Pubblicazione: (2024)
di: Wei, Cong, et al.
Pubblicazione: (2024)
InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models
di: Wei, Cong, et al.
Pubblicazione: (2024)
di: Wei, Cong, et al.
Pubblicazione: (2024)
Advancing Visual Large Language Model for Multi-granular Versatile Perception
di: Xiang, Wentao, et al.
Pubblicazione: (2025)
di: Xiang, Wentao, et al.
Pubblicazione: (2025)
LinVT: Empower Your Image-level Large Language Model to Understand Videos
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
di: Gao, Lishuai, et al.
Pubblicazione: (2024)
Universal Segmentation at Arbitrary Granularity with Language Instruction
di: Liu, Yong, et al.
Pubblicazione: (2023)
di: Liu, Yong, et al.
Pubblicazione: (2023)
Rethinking Query-based Transformer for Continual Image Segmentation
di: Zhu, Yuchen, et al.
Pubblicazione: (2025)
di: Zhu, Yuchen, et al.
Pubblicazione: (2025)
DisTime: Distribution-based Time Representation for Video Large Language Models
di: Zeng, Yingsen, et al.
Pubblicazione: (2025)
di: Zeng, Yingsen, et al.
Pubblicazione: (2025)
Query-guided Prototype Evolution Network for Few-Shot Segmentation
di: Cong, Runmin, et al.
Pubblicazione: (2024)
di: Cong, Runmin, et al.
Pubblicazione: (2024)
A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment
di: Wu, Tianhe, et al.
Pubblicazione: (2024)
di: Wu, Tianhe, et al.
Pubblicazione: (2024)
Semi-supervised Medical Image Segmentation via Query Distribution Consistency
di: Wu, Rong, et al.
Pubblicazione: (2023)
di: Wu, Rong, et al.
Pubblicazione: (2023)
TalkFashion: Intelligent Virtual Try-On Assistant Based on Multimodal Large Language Model
di: Hu, Yujie, et al.
Pubblicazione: (2025)
di: Hu, Yujie, et al.
Pubblicazione: (2025)
AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation
di: Qian, Rui, et al.
Pubblicazione: (2026)
di: Qian, Rui, et al.
Pubblicazione: (2026)
MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices
di: Chu, Xiangxiang, et al.
Pubblicazione: (2023)
di: Chu, Xiangxiang, et al.
Pubblicazione: (2023)
DECO: Unleashing the Potential of ConvNets for Query-based Detection and Segmentation
di: Chen, Xinghao, et al.
Pubblicazione: (2023)
di: Chen, Xinghao, et al.
Pubblicazione: (2023)
IG-Diff: Complex Night Scene Restoration with Illumination-Guided Diffusion Model
di: Chen, Yifan, et al.
Pubblicazione: (2026)
di: Chen, Yifan, et al.
Pubblicazione: (2026)
Efficient Temporal Action Segmentation via Boundary-aware Query Voting
di: Wang, Peiyao, et al.
Pubblicazione: (2024)
di: Wang, Peiyao, et al.
Pubblicazione: (2024)
LLMRA: Multi-modal Large Language Model based Restoration Assistant
di: Jin, Xiaoyu, et al.
Pubblicazione: (2024)
di: Jin, Xiaoyu, et al.
Pubblicazione: (2024)
Cs2K: Class-specific and Class-shared Knowledge Guidance for Incremental Semantic Segmentation
di: Cong, Wei, et al.
Pubblicazione: (2024)
di: Cong, Wei, et al.
Pubblicazione: (2024)
UniMD: Towards Unifying Moment Retrieval and Temporal Action Detection
di: Zeng, Yingsen, et al.
Pubblicazione: (2024)
di: Zeng, Yingsen, et al.
Pubblicazione: (2024)
SAM-DAQ: Segment Anything Model with Depth-guided Adaptive Queries for RGB-D Video Salient Object Detection
di: Lin, Jia, et al.
Pubblicazione: (2025)
di: Lin, Jia, et al.
Pubblicazione: (2025)
Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models
di: Jia, Kaidi, et al.
Pubblicazione: (2026)
di: Jia, Kaidi, et al.
Pubblicazione: (2026)
Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model
di: Huang, Yifei, et al.
Pubblicazione: (2024)
di: Huang, Yifei, et al.
Pubblicazione: (2024)
The Silent Assistant: NoiseQuery as Implicit Guidance for Goal-Driven Image Generation
di: Wang, Ruoyu, et al.
Pubblicazione: (2024)
di: Wang, Ruoyu, et al.
Pubblicazione: (2024)
Mitigating the Reasoning Tax in Vision-Language Fine-Tuning with Input-Adaptive Depth Aggregation
di: Ren, Yiming, et al.
Pubblicazione: (2026)
di: Ren, Yiming, et al.
Pubblicazione: (2026)
HiMix: Reducing Computational Complexity in Large Vision-Language Models
di: Zhang, Xuange, et al.
Pubblicazione: (2025)
di: Zhang, Xuange, et al.
Pubblicazione: (2025)
Referring Video Object Segmentation with Cross-Modality Proxy Queries
di: Sun, Baoli, et al.
Pubblicazione: (2025)
di: Sun, Baoli, et al.
Pubblicazione: (2025)
Mixed-Query Transformer: A Unified Image Segmentation Architecture
di: Wang, Pei, et al.
Pubblicazione: (2024)
di: Wang, Pei, et al.
Pubblicazione: (2024)
v-CLR: View-Consistent Learning for Open-World Instance Segmentation
di: Zhang, Chang-Bin, et al.
Pubblicazione: (2025)
di: Zhang, Chang-Bin, et al.
Pubblicazione: (2025)
LLMGA: Multimodal Large Language Model based Generation Assistant
di: Xia, Bin, et al.
Pubblicazione: (2023)
di: Xia, Bin, et al.
Pubblicazione: (2023)
Learning Semantic-Aware Representation in Visual-Language Models for Multi-Label Recognition with Partial Labels
di: Ruan, Haoxian, et al.
Pubblicazione: (2024)
di: Ruan, Haoxian, et al.
Pubblicazione: (2024)
TalkPhoto: A Versatile Training-Free Conversational Assistant for Intelligent Image Editing
di: Hu, Yujie, et al.
Pubblicazione: (2026)
di: Hu, Yujie, et al.
Pubblicazione: (2026)
Query-aware Hub Prototype Learning for Few-Shot 3D Point Cloud Semantic Segmentation
di: Zhou, YiLin, et al.
Pubblicazione: (2025)
di: Zhou, YiLin, et al.
Pubblicazione: (2025)
OoDDINO:A Multi-level Framework for Anomaly Segmentation on Complex Road Scenes
di: Liu, Yuxing, et al.
Pubblicazione: (2025)
di: Liu, Yuxing, et al.
Pubblicazione: (2025)
InstaGen: Enhancing Object Detection by Training on Synthetic Dataset
di: Feng, Chengjian, et al.
Pubblicazione: (2024)
di: Feng, Chengjian, et al.
Pubblicazione: (2024)
Temporal-Enhanced Multimodal Transformer for Referring Multi-Object Tracking and Segmentation
di: Xiao, Changcheng, et al.
Pubblicazione: (2024)
di: Xiao, Changcheng, et al.
Pubblicazione: (2024)
Towards Visual Query Segmentation in the Wild
di: Fan, Bing, et al.
Pubblicazione: (2026)
di: Fan, Bing, et al.
Pubblicazione: (2026)
PanopticQuery: Unified Query-Time Reasoning for 4D Scenes
di: Tang, Ruilin, et al.
Pubblicazione: (2026)
di: Tang, Ruilin, et al.
Pubblicazione: (2026)
VIRST: Video-Instructed Reasoning Assistant for SpatioTemporal Segmentation
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
di: Hong, Jihwan, et al.
Pubblicazione: (2026)
FarmMind: Reasoning-Query-Driven Dynamic Segmentation for Farmland Remote Sensing Images
di: Wu, Haiyang, et al.
Pubblicazione: (2026)
di: Wu, Haiyang, et al.
Pubblicazione: (2026)
Rolling Shutter Correction with Intermediate Distortion Flow Estimation
di: Cao, Mingdeng, et al.
Pubblicazione: (2024)
di: Cao, Mingdeng, et al.
Pubblicazione: (2024)
Documenti analoghi
-
HyperSeg: Towards Universal Visual Segmentation with Large Language Model
di: Wei, Cong, et al.
Pubblicazione: (2024) -
InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models
di: Wei, Cong, et al.
Pubblicazione: (2024) -
Advancing Visual Large Language Model for Multi-granular Versatile Perception
di: Xiang, Wentao, et al.
Pubblicazione: (2025) -
LinVT: Empower Your Image-level Large Language Model to Understand Videos
di: Gao, Lishuai, et al.
Pubblicazione: (2024) -
Universal Segmentation at Arbitrary Granularity with Language Instruction
di: Liu, Yong, et al.
Pubblicazione: (2023)