Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks
Fuente:
arXiv
Guardado en:
| Autores principales: | Jia, Mengzhao, Yu, Wenhao, Ma, Kaixin, Fang, Tianqing, Zhang, Zhihan, Ouyang, Siru, Zhang, Hongming, Yu, Dong, Jiang, Meng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RepoGraph: Enhancing AI Software Engineering with Repository-level Code Graph
por: Ouyang, Siru, et al.
Publicado: (2024)
por: Ouyang, Siru, et al.
Publicado: (2024)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
por: Zhang, Ce, et al.
Publicado: (2025)
por: Zhang, Ce, et al.
Publicado: (2025)
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
por: Zhu, Zifeng, et al.
Publicado: (2024)
por: Zhu, Zifeng, et al.
Publicado: (2024)
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
por: Fang, Tianqing, et al.
Publicado: (2025)
por: Fang, Tianqing, et al.
Publicado: (2025)
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
por: Zhang, Zhisong, et al.
Publicado: (2025)
por: Zhang, Zhisong, et al.
Publicado: (2025)
Describe-then-Reason: Improving Multimodal Mathematical Reasoning through Visual Comprehension Training
por: Jia, Mengzhao, et al.
Publicado: (2024)
por: Jia, Mengzhao, et al.
Publicado: (2024)
PLUG: Leveraging Pivot Language in Cross-Lingual Instruction Tuning
por: Zhang, Zhihan, et al.
Publicado: (2023)
por: Zhang, Zhihan, et al.
Publicado: (2023)
Learn Beyond The Answer: Training Language Models with Reflection for Mathematical Reasoning
por: Zhang, Zhihan, et al.
Publicado: (2024)
por: Zhang, Zhihan, et al.
Publicado: (2024)
Prioritizing the Best: Incentivizing Reliable Multimodal Reasoning by Rewarding Beyond Answer Correctness
por: Jia, Mengzhao, et al.
Publicado: (2026)
por: Jia, Mengzhao, et al.
Publicado: (2026)
OpenWebVoyager: Building Multimodal Web Agents via Iterative Real-World Exploration, Feedback and Optimization
por: He, Hongliang, et al.
Publicado: (2024)
por: He, Hongliang, et al.
Publicado: (2024)
DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes
por: Wang, Zhaowei, et al.
Publicado: (2024)
por: Wang, Zhaowei, et al.
Publicado: (2024)
Chain-of-Note: Enhancing Robustness in Retrieval-Augmented Language Models
por: Yu, Wenhao, et al.
Publicado: (2023)
por: Yu, Wenhao, et al.
Publicado: (2023)
Understanding and Enhancing Mamba-Transformer Hybrids for Memory Recall and Language Modeling
por: Lee, Hyunji, et al.
Publicado: (2025)
por: Lee, Hyunji, et al.
Publicado: (2025)
LASER: LLM Agent with State-Space Exploration for Web Navigation
por: Ma, Kaixin, et al.
Publicado: (2023)
por: Ma, Kaixin, et al.
Publicado: (2023)
Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation
por: Ma, Junyu, et al.
Publicado: (2025)
por: Ma, Junyu, et al.
Publicado: (2025)
ParallelSpec: Parallel Drafter for Efficient Speculative Decoding
por: Xiao, Zilin, et al.
Publicado: (2024)
por: Xiao, Zilin, et al.
Publicado: (2024)
DOCBENCH: A Benchmark for Evaluating LLM-based Document Reading Systems
por: Zou, Anni, et al.
Publicado: (2024)
por: Zou, Anni, et al.
Publicado: (2024)
AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning
por: Jia, Mengzhao, et al.
Publicado: (2025)
por: Jia, Mengzhao, et al.
Publicado: (2025)
Retrieval-augmented GUI Agents with Generative Guidelines
por: Xu, Ran, et al.
Publicado: (2025)
por: Xu, Ran, et al.
Publicado: (2025)
WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models
por: He, Hongliang, et al.
Publicado: (2024)
por: He, Hongliang, et al.
Publicado: (2024)
Attention Entropy is a Key Factor: An Analysis of Parallel Context Encoding with Full-attention-based Pre-trained Language Models
por: Zhang, Zhisong, et al.
Publicado: (2024)
por: Zhang, Zhisong, et al.
Publicado: (2024)
Dense X Retrieval: What Retrieval Granularity Should We Use?
por: Chen, Tong, et al.
Publicado: (2023)
por: Chen, Tong, et al.
Publicado: (2023)
MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring
por: Yang, Tengchao, et al.
Publicado: (2025)
por: Yang, Tengchao, et al.
Publicado: (2025)
DSBench: How Far Are Data Science Agents from Becoming Data Science Experts?
por: Jing, Liqiang, et al.
Publicado: (2024)
por: Jing, Liqiang, et al.
Publicado: (2024)
OpenCharacter: Training Customizable Role-Playing LLMs with Large-Scale Synthetic Personas
por: Wang, Xiaoyang, et al.
Publicado: (2025)
por: Wang, Xiaoyang, et al.
Publicado: (2025)
On-the-fly Denoising for Data Augmentation in Natural Language Understanding
por: Fang, Tianqing, et al.
Publicado: (2022)
por: Fang, Tianqing, et al.
Publicado: (2022)
WebCoT: Enhancing Web Agent Reasoning by Reconstructing Chain-of-Thought in Reflection, Branching, and Rollback
por: Hu, Minda, et al.
Publicado: (2025)
por: Hu, Minda, et al.
Publicado: (2025)
Don't Throw Away Your Pretrained Model
por: Feng, Shangbin, et al.
Publicado: (2025)
por: Feng, Shangbin, et al.
Publicado: (2025)
UniGist: Towards General and Hardware-aligned Sequence-level Long Context Compression
por: Deng, Chenlong, et al.
Publicado: (2025)
por: Deng, Chenlong, et al.
Publicado: (2025)
InComeS: Integrating Compression and Selection Mechanisms into LLMs for Efficient Model Editing
por: Li, Shuaiyi, et al.
Publicado: (2025)
por: Li, Shuaiyi, et al.
Publicado: (2025)
ProxyThinker: Test-Time Guidance through Small Visual Reasoners
por: Xiao, Zilin, et al.
Publicado: (2025)
por: Xiao, Zilin, et al.
Publicado: (2025)
Multi-LoRA Composition for Image Generation
por: Zhong, Ming, et al.
Publicado: (2024)
por: Zhong, Ming, et al.
Publicado: (2024)
Towards End-to-End Open Conversational Machine Reading
por: Zhou, Sizhe, et al.
Publicado: (2022)
por: Zhou, Sizhe, et al.
Publicado: (2022)
SemEval-2024 Task 9: BRAINTEASER: A Novel Task Defying Common Sense
por: Jiang, Yifan, et al.
Publicado: (2024)
por: Jiang, Yifan, et al.
Publicado: (2024)
SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation
por: Ma, Zhiming, et al.
Publicado: (2025)
por: Ma, Zhiming, et al.
Publicado: (2025)
InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model
por: Dong, Xiaoyi, et al.
Publicado: (2024)
por: Dong, Xiaoyi, et al.
Publicado: (2024)
Abstraction-of-Thought Makes Language Models Better Reasoners
por: Hong, Ruixin, et al.
Publicado: (2024)
por: Hong, Ruixin, et al.
Publicado: (2024)
Guided Self-Evolving LLMs with Minimal Human Supervision
por: Yu, Wenhao, et al.
Publicado: (2025)
por: Yu, Wenhao, et al.
Publicado: (2025)
A Survey on Retrieval And Structuring Augmented Generation with Large Language Models
por: Jiang, Pengcheng, et al.
Publicado: (2025)
por: Jiang, Pengcheng, et al.
Publicado: (2025)
WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models
por: Wang, Rui, et al.
Publicado: (2025)
por: Wang, Rui, et al.
Publicado: (2025)
Ejemplares similares
-
RepoGraph: Enhancing AI Software Engineering with Repository-level Code Graph
por: Ouyang, Siru, et al.
Publicado: (2024) -
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
por: Zhang, Ce, et al.
Publicado: (2025) -
MultiChartQA: Benchmarking Vision-Language Models on Multi-Chart Problems
por: Zhu, Zifeng, et al.
Publicado: (2024) -
WebEvolver: Enhancing Web Agent Self-Improvement with Coevolving World Model
por: Fang, Tianqing, et al.
Publicado: (2025) -
WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms
por: Zhang, Zhisong, et al.
Publicado: (2025)