Guardado en:
| Autores principales: | Wu, Tsung-Han, Biamby, Giscard, Quenum, Jerome, Gupta, Ritwik, Gonzalez, Joseph E., Darrell, Trevor, Chan, David M. |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2407.13766 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning
por: Niu, Dantong, et al.
Publicado: (2024)
por: Niu, Dantong, et al.
Publicado: (2024)
Needle In A Multimodal Haystack
por: Wang, Weiyun, et al.
Publicado: (2024)
por: Wang, Weiyun, et al.
Publicado: (2024)
Two Causally Related Needles in a Video Haystack
por: Li, Miaoyu, et al.
Publicado: (2025)
por: Li, Miaoyu, et al.
Publicado: (2025)
LISAT: Language-Instructed Segmentation Assistant for Satellite Imagery
por: Quenum, Jerome, et al.
Publicado: (2025)
por: Quenum, Jerome, et al.
Publicado: (2025)
Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs
por: Zhao, Zijia, et al.
Publicado: (2024)
por: Zhao, Zijia, et al.
Publicado: (2024)
Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling
por: Wu, Tsung-Han, et al.
Publicado: (2025)
por: Wu, Tsung-Han, et al.
Publicado: (2025)
Losing Visual Needles in Image Haystacks: Vision Language Models are Easily Distracted in Short and Long Contexts
por: Sharma, Aditya, et al.
Publicado: (2024)
por: Sharma, Aditya, et al.
Publicado: (2024)
REOrdering Patches Improves Vision Models
por: Kutscher, Declan, et al.
Publicado: (2025)
por: Kutscher, Declan, et al.
Publicado: (2025)
MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks
por: Chowdhury, Sanjoy, et al.
Publicado: (2025)
por: Chowdhury, Sanjoy, et al.
Publicado: (2025)
Multimodal Needle in a Haystack: Benchmarking Long-Context Capability of Multimodal Large Language Models
por: Wang, Hengyi, et al.
Publicado: (2024)
por: Wang, Hengyi, et al.
Publicado: (2024)
Needle in a Haystack: One-Class Representation Learning for Detecting Rare Malignant Cells in Computational Cytology
por: Chatterjee, Swarnadip, et al.
Publicado: (2026)
por: Chatterjee, Swarnadip, et al.
Publicado: (2026)
Document Haystack: A Long Context Multimodal Image/Document Understanding Vision LLM Benchmark
por: Huybrechts, Goeric, et al.
Publicado: (2025)
por: Huybrechts, Goeric, et al.
Publicado: (2025)
Document Haystacks: Vision-Language Reasoning Over Piles of 1000+ Documents
por: Chen, Jun, et al.
Publicado: (2024)
por: Chen, Jun, et al.
Publicado: (2024)
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
por: Lee, Heekyung, et al.
Publicado: (2025)
por: Lee, Heekyung, et al.
Publicado: (2025)
MultiHaystack: Benchmarking Multimodal Retrieval and Reasoning over 40K Images, Videos, and Documents
por: Xu, Dannong, et al.
Publicado: (2026)
por: Xu, Dannong, et al.
Publicado: (2026)
Multi-axis Analysis of Image Manipulation Localization
por: Nichols, Keanu, et al.
Publicado: (2026)
por: Nichols, Keanu, et al.
Publicado: (2026)
Reasoning on Multiple Needles In A Haystack
por: Wang, Yidong
Publicado: (2025)
por: Wang, Yidong
Publicado: (2025)
Finding Outliers in a Haystack: Anomaly Detection for Large Pointcloud Scenes
por: Faulkner, Ryan, et al.
Publicado: (2025)
por: Faulkner, Ryan, et al.
Publicado: (2025)
xT: Nested Tokenization for Larger Context in Large Images
por: Gupta, Ritwik, et al.
Publicado: (2024)
por: Gupta, Ritwik, et al.
Publicado: (2024)
Looking for the Information Needle in the Internet Haystack.
por: Clausen, Helge
Publicado: (1996)
por: Clausen, Helge
Publicado: (1996)
Finding BSM Needles in Electromagnetic Haystacks at DUNE
por: Brdar, Vedran, et al.
Publicado: (2025)
por: Brdar, Vedran, et al.
Publicado: (2025)
Sequential-NIAH: A Needle-In-A-Haystack Benchmark for Extracting Sequential Needles from Long Contexts
por: Yu, Yifei, et al.
Publicado: (2025)
por: Yu, Yifei, et al.
Publicado: (2025)
ALOHa: A New Measure for Hallucination in Captioning Models
por: Petryk, Suzanne, et al.
Publicado: (2024)
por: Petryk, Suzanne, et al.
Publicado: (2024)
Needle in the Haystack for Memory Based Large Language Models
por: Nelson, Elliot, et al.
Publicado: (2024)
por: Nelson, Elliot, et al.
Publicado: (2024)
Finding Interest Needle in Popularity Haystack: Improving Retrieval by Modeling Item Exposure
por: Agarwal, Rahul, et al.
Publicado: (2025)
por: Agarwal, Rahul, et al.
Publicado: (2025)
When Do We Not Need Larger Vision Models?
por: Shi, Baifeng, et al.
Publicado: (2024)
por: Shi, Baifeng, et al.
Publicado: (2024)
CLAIR-A: Leveraging Large Language Models to Judge Audio Captions
por: Wu, Tsung-Han, et al.
Publicado: (2024)
por: Wu, Tsung-Han, et al.
Publicado: (2024)
Vision-Language Models Create Cross-Modal Task Representations
por: Luo, Grace, et al.
Publicado: (2024)
por: Luo, Grace, et al.
Publicado: (2024)
Jailbreaking in the Haystack
por: Shah, Rishi Rajesh, et al.
Publicado: (2025)
por: Shah, Rishi Rajesh, et al.
Publicado: (2025)
VisionArena: 230K Real World User-VLM Conversations with Preference Labels
por: Chou, Christopher, et al.
Publicado: (2024)
por: Chou, Christopher, et al.
Publicado: (2024)
Analyzing The Language of Visual Tokens
por: Chan, David M., et al.
Publicado: (2024)
por: Chan, David M., et al.
Publicado: (2024)
DENIAHL: In-Context Features Influence LLM Needle-In-A-Haystack Abilities
por: Dai, Hui, et al.
Publicado: (2024)
por: Dai, Hui, et al.
Publicado: (2024)
Finding Visual Task Vectors
por: Hojel, Alberto, et al.
Publicado: (2024)
por: Hojel, Alberto, et al.
Publicado: (2024)
GOLD PANNING: Strategic Context Shuffling for Needle-in-Haystack Reasoning
por: Byerly, Adam, et al.
Publicado: (2025)
por: Byerly, Adam, et al.
Publicado: (2025)
Hidden in the Haystack: Smaller Needles are More Difficult for LLMs to Find
por: Bianchi, Owen, et al.
Publicado: (2025)
por: Bianchi, Owen, et al.
Publicado: (2025)
Needles in Haystacks: Exploring Selective Novel Adsorbents for PFAS Treatment
por: Bryan Sadowski, et al.
Publicado: (2026)
por: Bryan Sadowski, et al.
Publicado: (2026)
DAVE: A VLM Vision Encoder for Document Understanding and Web Agents
por: Huang, Brandon, et al.
Publicado: (2025)
por: Huang, Brandon, et al.
Publicado: (2025)
Visually Prompted Benchmarks Are Surprisingly Fragile
por: Feng, Haiwen, et al.
Publicado: (2025)
por: Feng, Haiwen, et al.
Publicado: (2025)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
por: Shan, Haozhe, et al.
Publicado: (2026)
por: Shan, Haozhe, et al.
Publicado: (2026)
Recursive Visual Programming
por: Ge, Jiaxin, et al.
Publicado: (2023)
por: Ge, Jiaxin, et al.
Publicado: (2023)
Ejemplares similares
-
LLARVA: Vision-Action Instruction Tuning Enhances Robot Learning
por: Niu, Dantong, et al.
Publicado: (2024) -
Needle In A Multimodal Haystack
por: Wang, Weiyun, et al.
Publicado: (2024) -
Two Causally Related Needles in a Video Haystack
por: Li, Miaoyu, et al.
Publicado: (2025) -
LISAT: Language-Instructed Segmentation Assistant for Satellite Imagery
por: Quenum, Jerome, et al.
Publicado: (2025) -
Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs
por: Zhao, Zijia, et al.
Publicado: (2024)