LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Zhang, Yang, Biao, Liu, Qiang, Zhang, Shuo, Ma, Zhiyin, Yin, Liang, Deng, Linger, Sun, Yabo, Liu, Yuliang, Bai, Xiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
por: Li, Zhang, et al.
Publicado: (2023)
por: Li, Zhang, et al.
Publicado: (2023)
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
por: Liu, Yuliang, et al.
Publicado: (2024)
por: Liu, Yuliang, et al.
Publicado: (2024)
Exploring the Capabilities of Large Multimodal Models on Dense Text
por: Zhang, Shuo, et al.
Publicado: (2024)
por: Zhang, Shuo, et al.
Publicado: (2024)
GeoFocus: Blending Efficient Global-to-Local Perception for Multimodal Geometry Problem-Solving
por: Deng, Linger, et al.
Publicado: (2026)
por: Deng, Linger, et al.
Publicado: (2026)
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
por: Li, Zhang, et al.
Publicado: (2025)
por: Li, Zhang, et al.
Publicado: (2025)
Progressive Evolution from Single-Point to Polygon for Scene Text
por: Deng, Linger, et al.
Publicado: (2023)
por: Deng, Linger, et al.
Publicado: (2023)
MSTAR: Box-free Multi-query Scene Text Retrieval with Attention Recycling
por: Yin, Liang, et al.
Publicado: (2025)
por: Yin, Liang, et al.
Publicado: (2025)
Liquid: Language Models are Scalable and Unified Multi-modal Generators
por: Wu, Junfeng, et al.
Publicado: (2024)
por: Wu, Junfeng, et al.
Publicado: (2024)
Theorem-Validated Reverse Chain-of-Thought Problem Generation for Geometric Reasoning
por: Deng, Linger, et al.
Publicado: (2024)
por: Deng, Linger, et al.
Publicado: (2024)
PSALM: Pixelwise SegmentAtion with Large Multi-Modal Model
por: Zhang, Zheng, et al.
Publicado: (2024)
por: Zhang, Zheng, et al.
Publicado: (2024)
VimTS: A Unified Video and Image Text Spotter for Enhancing the Cross-domain Generalization
por: Liu, Yuliang, et al.
Publicado: (2024)
por: Liu, Yuliang, et al.
Publicado: (2024)
THE JOURNEY OF LIRA
por: KIRAM, MYRNA S.
Publicado: (2026)
por: KIRAM, MYRNA S.
Publicado: (2026)
mmWalk: Towards Multi-modal Multi-view Walking Assistance
por: Ying, Kedi, et al.
Publicado: (2025)
por: Ying, Kedi, et al.
Publicado: (2025)
OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models
por: Liu, Yuliang, et al.
Publicado: (2023)
por: Liu, Yuliang, et al.
Publicado: (2023)
Apresentação
por: Carlos Linger
Publicado: (2016)
por: Carlos Linger
Publicado: (2016)
Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation
por: Zhang, Yabo, et al.
Publicado: (2026)
por: Zhang, Yabo, et al.
Publicado: (2026)
Wan-Weaver: Interleaved Multi-modal Generation via Decoupled Training
por: Xing, Jinbo, et al.
Publicado: (2026)
por: Xing, Jinbo, et al.
Publicado: (2026)
MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios
por: Li, Zhang, et al.
Publicado: (2026)
por: Li, Zhang, et al.
Publicado: (2026)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
por: Zhang, Kaichen, et al.
Publicado: (2024)
por: Zhang, Kaichen, et al.
Publicado: (2024)
DocThinker: Explainable Multimodal Large Language Models with Rule-based Reinforcement Learning for Document Understanding
por: Yu, Wenwen, et al.
Publicado: (2025)
por: Yu, Wenwen, et al.
Publicado: (2025)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
por: Tian, Changyao, et al.
Publicado: (2024)
por: Tian, Changyao, et al.
Publicado: (2024)
RealSyn: An Effective and Scalable Multimodal Interleaved Document Transformation Paradigm
por: Gu, Tiancheng, et al.
Publicado: (2025)
por: Gu, Tiancheng, et al.
Publicado: (2025)
SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens
por: Zhang, Xiaoyan, et al.
Publicado: (2026)
por: Zhang, Xiaoyan, et al.
Publicado: (2026)
LIRA: A Learning-based Query-aware Partition Framework for Large-scale ANN Search
por: Zeng, Ximu, et al.
Publicado: (2025)
por: Zeng, Ximu, et al.
Publicado: (2025)
Interaction Behaviors of Ce‐Treated Al‐Killed Steel Grades with Different Refractories
por: Huixin Liu, et al.
Publicado: (2024)
por: Huixin Liu, et al.
Publicado: (2024)
OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving
por: Zhang, Zhenguo, et al.
Publicado: (2025)
por: Zhang, Zhenguo, et al.
Publicado: (2025)
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
por: Guan, Yiran, et al.
Publicado: (2026)
por: Guan, Yiran, et al.
Publicado: (2026)
Empowering Segmentation Ability to Multi-modal Large Language Models
por: Yang, Yuqi, et al.
Publicado: (2024)
por: Yang, Yuqi, et al.
Publicado: (2024)
PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling
por: Xie, Xudong, et al.
Publicado: (2024)
por: Xie, Xudong, et al.
Publicado: (2024)
Phosphorus Limitation Constrains Global Forest Productivity Directly and Indirectly via Forest Community Structural Attributes: Meta‐Analysis
por: Ewuketu Linger, et al.
Publicado: (2025)
por: Ewuketu Linger, et al.
Publicado: (2025)
Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid
por: Huang, Mingxin, et al.
Publicado: (2024)
por: Huang, Mingxin, et al.
Publicado: (2024)
InsTALL: Context-aware Instructional Task Assistance with Multi-modal Large Language Models
por: Nguyen, Pha, et al.
Publicado: (2025)
por: Nguyen, Pha, et al.
Publicado: (2025)
WMKA-Net: A Weighted Multi-Kernel Attention Network for Retinal Vessel Segmentation
por: Xu, Xinran, et al.
Publicado: (2025)
por: Xu, Xinran, et al.
Publicado: (2025)
MIMNet: Multi-Interest Meta Network with Multi-Granularity Target-Guided Attention for Cross-domain Recommendation
por: Zhu, Xiaofei, et al.
Publicado: (2024)
por: Zhu, Xiaofei, et al.
Publicado: (2024)
LoginMEA: Local-to-Global Interaction Network for Multi-modal Entity Alignment
por: Su, Taoyu, et al.
Publicado: (2024)
por: Su, Taoyu, et al.
Publicado: (2024)
Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation
por: Liao, Chao, et al.
Publicado: (2025)
por: Liao, Chao, et al.
Publicado: (2025)
LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models
por: Li, Feng, et al.
Publicado: (2024)
por: Li, Feng, et al.
Publicado: (2024)
UNA LIRA DESOLADA: PARODIA Y FRUSTRACIÓN EN PROYECTO DE OBRAS COMPLETAS Y DECLARACIÓN JURADA DE RODRIGO LIRA
por: Andrés Cáceres Milnes
Publicado: (2016)
por: Andrés Cáceres Milnes
Publicado: (2016)
CoRA: Collaborative Information Perception by Large Language Model's Weights for Recommendation
por: Liu, Yuting, et al.
Publicado: (2024)
por: Liu, Yuting, et al.
Publicado: (2024)
Improving Multi-modal Large Language Model through Boosting Vision Capabilities
por: Sun, Yanpeng, et al.
Publicado: (2024)
por: Sun, Yanpeng, et al.
Publicado: (2024)
Ejemplares similares
-
Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models
por: Li, Zhang, et al.
Publicado: (2023) -
TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document
por: Liu, Yuliang, et al.
Publicado: (2024) -
Exploring the Capabilities of Large Multimodal Models on Dense Text
por: Zhang, Shuo, et al.
Publicado: (2024) -
GeoFocus: Blending Efficient Global-to-Local Perception for Multimodal Geometry Problem-Solving
por: Deng, Linger, et al.
Publicado: (2026) -
MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
por: Li, Zhang, et al.
Publicado: (2025)