CAPTURE: A Benchmark and Evaluation for LVLMs in CAPTCHA Resolving
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Jianyi, Zhou, Ziyin, Ji, Xu, Liu, Shizhao, Zhao, Zhangchi |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking
par: Zhang, Jianyi, et autres
Publié: (2025)
par: Zhang, Jianyi, et autres
Publié: (2025)
Oedipus and the Sphinx: Benchmarking and Improving Visual Language Models for Complex Graphic Reasoning
par: Zhang, Jianyi, et autres
Publié: (2025)
par: Zhang, Jianyi, et autres
Publié: (2025)
Tug-of-War within A Decade: Conflict Resolution in Vulnerability Analysis via Teacher-Guided Retrieval-Augmented Generations
par: Zhou, Ziyin, et autres
Publié: (2026)
par: Zhou, Ziyin, et autres
Publié: (2026)
Can't say cant? Measuring and Reasoning of Dark Jargons in Large Language Models
par: Ji, Xu, et autres
Publié: (2024)
par: Ji, Xu, et autres
Publié: (2024)
COGNITION: From Evaluation to Defense against Multimodal LLM CAPTCHA Solvers
par: Wang, Junyu, et autres
Publié: (2025)
par: Wang, Junyu, et autres
Publié: (2025)
Spatial CAPTCHA: Generatively Benchmarking Spatial Reasoning for Human-Machine Differentiation
par: Kharlamova, Arina, et autres
Publié: (2025)
par: Kharlamova, Arina, et autres
Publié: (2025)
INS-MMBench: A Comprehensive Benchmark for Evaluating LVLMs' Performance in Insurance
par: Lin, Chenwei, et autres
Publié: (2024)
par: Lin, Chenwei, et autres
Publié: (2024)
Interpreting Social Bias in LVLMs via Information Flow Analysis and Multi-Round Dialogue Evaluation
par: Ji, Zhengyang, et autres
Publié: (2025)
par: Ji, Zhengyang, et autres
Publié: (2025)
Rejuvenating Cross-Entropy Loss in Knowledge Distillation for Recommender Systems
par: Zhu, Zhangchi, et autres
Publié: (2025)
par: Zhu, Zhangchi, et autres
Publié: (2025)
Three Mechanisms of Feature Learning in a Linear Network
par: Xu, Yizhou, et autres
Publié: (2024)
par: Xu, Yizhou, et autres
Publié: (2024)
Exploring Feature-based Knowledge Distillation for Recommender System: A Frequency Perspective
par: Zhu, Zhangchi, et autres
Publié: (2024)
par: Zhu, Zhangchi, et autres
Publié: (2024)
Reverse CAPTCHA: Evaluating LLM Susceptibility to Invisible Unicode Instruction Injection
par: Graves, Marcus
Publié: (2026)
par: Graves, Marcus
Publié: (2026)
SAGE: A Service Agent Graph-guided Evaluation Benchmark
par: Shi, Ling, et autres
Publié: (2026)
par: Shi, Ling, et autres
Publié: (2026)
CAPTURE: Context-Aware Prompt Injection Testing and Robustness Enhancement
par: Kholkar, Gauri, et autres
Publié: (2025)
par: Kholkar, Gauri, et autres
Publié: (2025)
aCAPTCHA: Verifying That an Entity Is a Capable Agent via Asymmetric Hardness
par: Xu, Zuyao, et autres
Publié: (2026)
par: Xu, Zuyao, et autres
Publié: (2026)
MATEO: A Multimodal Benchmark for Temporal Reasoning and Planning in LVLMs
par: Roccabruna, Gabriel, et autres
Publié: (2026)
par: Roccabruna, Gabriel, et autres
Publié: (2026)
Advancing Deep Learning through Probability Engineering: A Pragmatic Paradigm for Modern AI
par: Zhang, Jianyi
Publié: (2025)
par: Zhang, Jianyi
Publié: (2025)
VisuoAlign: Safety Alignment of LVLMs with Multimodal Tree Search
par: Li, MingSheng, et autres
Publié: (2025)
par: Li, MingSheng, et autres
Publié: (2025)
A Unified Formal Theory on the Logical Limits of Symbol Grounding
par: Liu, Zhangchi
Publié: (2025)
par: Liu, Zhangchi
Publié: (2025)
AirQualityBench: A Realistic Evaluation Benchmark for Global Air Quality Forecasting
par: Xu, Xing, et autres
Publié: (2026)
par: Xu, Xing, et autres
Publié: (2026)
Beyond Retrieval: A Multitask Benchmark and Model for Code Search
par: Xue, Siqiao, et autres
Publié: (2026)
par: Xue, Siqiao, et autres
Publié: (2026)
Remove Symmetries to Control Model Expressivity and Improve Optimization
par: Ziyin, Liu, et autres
Publié: (2024)
par: Ziyin, Liu, et autres
Publié: (2024)
A Hybrid CAPTCHA Combining Generative AI with Keystroke Dynamics for Enhanced Bot Detection
par: Nia, Ayda Aghaei
Publié: (2025)
par: Nia, Ayda Aghaei
Publié: (2025)
Optimizing LVLMs with On-Policy Data for Effective Hallucination Mitigation
par: Yu, Chengzhi, et autres
Publié: (2025)
par: Yu, Chengzhi, et autres
Publié: (2025)
VidLBEval: Benchmarking and Mitigating Language Bias in Video-Involved LVLMs
par: Yang, Yiming, et autres
Publié: (2025)
par: Yang, Yiming, et autres
Publié: (2025)
From Black Box to Transparency: Enhancing Automated Interpreting Assessment with Explainable AI in College Classrooms
par: Jiang, Zhaokun, et autres
Publié: (2025)
par: Jiang, Zhaokun, et autres
Publié: (2025)
When Harmful Content Gets Camouflaged: Unveiling Perception Failure of LVLMs with CamHarmTI
par: Li, Yanhui, et autres
Publié: (2025)
par: Li, Yanhui, et autres
Publié: (2025)
ElecBench: a Power Dispatch Evaluation Benchmark for Large Language Models
par: Zhou, Xiyuan, et autres
Publié: (2024)
par: Zhou, Xiyuan, et autres
Publié: (2024)
An Algorithmic Information-Theoretic Perspective on the Symbol Grounding Problem
par: Liu, Zhangchi
Publié: (2025)
par: Liu, Zhangchi
Publié: (2025)
Causal-HalBench: Uncovering LVLMs Object Hallucinations Through Causal Intervention
par: Xu, Zhe, et autres
Publié: (2025)
par: Xu, Zhe, et autres
Publié: (2025)
Orchestrating Spatial Semantics via a Zone-Graph Paradigm for Intricate Indoor Scene Generation
par: Zhang, Meisheng, et autres
Publié: (2026)
par: Zhang, Meisheng, et autres
Publié: (2026)
MELA: Multilingual Evaluation of Linguistic Acceptability
par: Zhang, Ziyin, et autres
Publié: (2023)
par: Zhang, Ziyin, et autres
Publié: (2023)
CaptchaMind: Training CAPTCHA Solvers via Reinforcement Learning with Explicit Reasoning Supervision
par: Wang, Pengcheng, et autres
Publié: (2026)
par: Wang, Pengcheng, et autres
Publié: (2026)
Improving Composed Image Retrieval via Contrastive Learning with Scaling Positives and Negatives
par: Feng, Zhangchi, et autres
Publié: (2024)
par: Feng, Zhangchi, et autres
Publié: (2024)
MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
Convergences and Divergences between Automatic Assessment and Human Evaluation: Insights from Comparing ChatGPT-Generated Translation and Neural Machine Translation
par: Jiang, Zhaokun, et autres
Publié: (2024)
par: Jiang, Zhaokun, et autres
Publié: (2024)
An Enhanced Prompt-Based LLM Reasoning Scheme via Knowledge Graph-Integrated Collaboration
par: Li, Yihao, et autres
Publié: (2024)
par: Li, Yihao, et autres
Publié: (2024)
EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving
par: Zhou, Xiyuan, et autres
Publié: (2025)
par: Zhou, Xiyuan, et autres
Publié: (2025)
Multi-SWE-bench: A Multilingual Benchmark for Issue Resolving
par: Zan, Daoguang, et autres
Publié: (2025)
par: Zan, Daoguang, et autres
Publié: (2025)
SoPE: Spherical Coordinate-Based Positional Embedding for Enhancing Spatial Perception of 3D LVLMs
par: Ye, Guanting, et autres
Publié: (2026)
par: Ye, Guanting, et autres
Publié: (2026)
Documents similaires
-
MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking
par: Zhang, Jianyi, et autres
Publié: (2025) -
Oedipus and the Sphinx: Benchmarking and Improving Visual Language Models for Complex Graphic Reasoning
par: Zhang, Jianyi, et autres
Publié: (2025) -
Tug-of-War within A Decade: Conflict Resolution in Vulnerability Analysis via Teacher-Guided Retrieval-Augmented Generations
par: Zhou, Ziyin, et autres
Publié: (2026) -
Can't say cant? Measuring and Reasoning of Dark Jargons in Large Language Models
par: Ji, Xu, et autres
Publié: (2024) -
COGNITION: From Evaluation to Defense against Multimodal LLM CAPTCHA Solvers
par: Wang, Junyu, et autres
Publié: (2025)