NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Xiang, Hua, Wenyue, Zhu, Kaijie, Li, Lingyao, Ling, Haoyang, Chi, Jinkui, Dou, Qi, Wang, Jindong, Zhang, Yongfeng, Ma, Xin, Fan, Lizhou |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes
by: Fan, Lizhou, et al.
Published: (2023)
by: Fan, Lizhou, et al.
Published: (2023)
War and Peace (WarAgent): Large Language Model-based Multi-Agent Simulation of World Wars
by: Hua, Wenyue, et al.
Published: (2023)
by: Hua, Wenyue, et al.
Published: (2023)
Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities
by: Hua, Wenyue, et al.
Published: (2024)
by: Hua, Wenyue, et al.
Published: (2024)
BattleAgent: Multi-modal Dynamic Emulation on Historical Battles to Complement Historical Analysis
by: Lin, Shuhang, et al.
Published: (2024)
by: Lin, Shuhang, et al.
Published: (2024)
Characterizing Online Toxicity During the 2022 Mpox Outbreak: A Computational Analysis of Topical and Network Dynamics
by: Fan, Lizhou, et al.
Published: (2024)
by: Fan, Lizhou, et al.
Published: (2024)
Toward Equitable Access: Leveraging Crowdsourced Reviews to Investigate Public Perceptions of Health Resource Accessibility
by: Xue, Zhaoqian, et al.
Published: (2025)
by: Xue, Zhaoqian, et al.
Published: (2025)
AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models
by: Shu, Dong, et al.
Published: (2024)
by: Shu, Dong, et al.
Published: (2024)
"HOT" ChatGPT: The promise of ChatGPT in detecting and discriminating hateful, offensive, and toxic comments on social media
by: Li, Lingyao, et al.
Published: (2023)
by: Li, Lingyao, et al.
Published: (2023)
EmojiPrompt: Generative Prompt Obfuscation for Privacy-Preserving Communication with Cloud-based LLMs
by: Lin, Sam, et al.
Published: (2024)
by: Lin, Sam, et al.
Published: (2024)
Game-theoretic LLM: Agent Workflow for Negotiation Games
by: Hua, Wenyue, et al.
Published: (2024)
by: Hua, Wenyue, et al.
Published: (2024)
Large Language Models in Biomedical and Health Informatics: A Review with Bibliometric Analysis
by: Yu, Huizi, et al.
Published: (2024)
by: Yu, Huizi, et al.
Published: (2024)
A Multimodal, Multilingual, and Multidimensional Pipeline for Fine-grained Crowdsourcing Earthquake Damage Evaluation
by: Ma, Zihui, et al.
Published: (2025)
by: Ma, Zihui, et al.
Published: (2025)
Interactive Speculative Planning: Enhance Agent Efficiency through Co-design of System and User Interface
by: Hua, Wenyue, et al.
Published: (2024)
by: Hua, Wenyue, et al.
Published: (2024)
Improving Adversarial Transferability in MLLMs via Dynamic Vision-Language Alignment Attack
by: Gu, Chenhe, et al.
Published: (2025)
by: Gu, Chenhe, et al.
Published: (2025)
Dynamic Evaluation of Large Language Models by Meta Probing Agents
by: Zhu, Kaijie, et al.
Published: (2024)
by: Zhu, Kaijie, et al.
Published: (2024)
MoralBench: Moral Evaluation of LLMs
by: Ji, Jianchao, et al.
Published: (2024)
by: Ji, Jianchao, et al.
Published: (2024)
Health-LLM: Personalized Retrieval-Augmented Disease Prediction System
by: Yu, Qinkai, et al.
Published: (2024)
by: Yu, Qinkai, et al.
Published: (2024)
DispatchMAS: Fusing taxonomy and artificial intelligence agents for emergency medical services
by: Li, Xiang, et al.
Published: (2025)
by: Li, Xiang, et al.
Published: (2025)
ColorBlindnessEval: Can Vision-Language Models Pass Color Blindness Tests?
by: Ling, Zijian, et al.
Published: (2025)
by: Ling, Zijian, et al.
Published: (2025)
ADO: Automatic Data Optimization for Inputs in LLM Prompts
by: Lin, Sam, et al.
Published: (2025)
by: Lin, Sam, et al.
Published: (2025)
Formal-LLM: Integrating Formal Language and Natural Language for Controllable LLM-based Agents
by: Li, Zelong, et al.
Published: (2024)
by: Li, Zelong, et al.
Published: (2024)
SOPBench: Evaluating Language Agents at Following Standard Operating Procedures and Constraints
by: Li, Zekun, et al.
Published: (2025)
by: Li, Zekun, et al.
Published: (2025)
Simulated patient systems powered by large language model-based AI agents offer potential for transforming medical education
by: Yu, Huizi, et al.
Published: (2024)
by: Yu, Huizi, et al.
Published: (2024)
The Rise of AI Agent Communities: Large-Scale Analysis of Discourse and Interaction on Moltbook
by: Li, Lingyao, et al.
Published: (2026)
by: Li, Lingyao, et al.
Published: (2026)
DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks
by: Zhu, Kaijie, et al.
Published: (2023)
by: Zhu, Kaijie, et al.
Published: (2023)
Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content
by: Zhang, Zicheng, et al.
Published: (2025)
by: Zhang, Zicheng, et al.
Published: (2025)
VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering
by: Wang, Yanling, et al.
Published: (2025)
by: Wang, Yanling, et al.
Published: (2025)
Fusion-Eval: Integrating Assistant Evaluators with LLMs
by: Shu, Lei, et al.
Published: (2023)
by: Shu, Lei, et al.
Published: (2023)
ReVisionLLM: Recursive Vision-Language Model for Temporal Grounding in Hour-Long Videos
by: Hannan, Tanveer, et al.
Published: (2024)
by: Hannan, Tanveer, et al.
Published: (2024)
IDGenRec: LLM-RecSys Alignment with Textual ID Learning
by: Tan, Juntao, et al.
Published: (2024)
by: Tan, Juntao, et al.
Published: (2024)
PromptBench: A Unified Library for Evaluation of Large Language Models
by: Zhu, Kaijie, et al.
Published: (2023)
by: Zhu, Kaijie, et al.
Published: (2023)
HELPD: Mitigating Hallucination of LVLMs by Hierarchical Feedback Learning with Vision-enhanced Penalty Decoding
by: Yuan, Fan, et al.
Published: (2024)
by: Yuan, Fan, et al.
Published: (2024)
UP5: Unbiased Foundation Model for Fairness-aware Recommendation
by: Hua, Wenyue, et al.
Published: (2023)
by: Hua, Wenyue, et al.
Published: (2023)
AlphaEval: Evaluating Agents in Production
by: Lu, Pengrui, et al.
Published: (2026)
by: Lu, Pengrui, et al.
Published: (2026)
PyVision: Agentic Vision with Dynamic Tooling
by: Zhao, Shitian, et al.
Published: (2025)
by: Zhao, Shitian, et al.
Published: (2025)
Cache Mechanism for Agent RAG Systems
by: Lin, Shuhang, et al.
Published: (2025)
by: Lin, Shuhang, et al.
Published: (2025)
Evaluating Vision-Language Models as Evaluators in Path Planning
by: Aghzal, Mohamed, et al.
Published: (2024)
by: Aghzal, Mohamed, et al.
Published: (2024)
VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
by: Qiu, Haoyi, et al.
Published: (2024)
by: Qiu, Haoyi, et al.
Published: (2024)
SparseEval: Efficient Evaluation of Large Language Models by Sparse Optimization
by: Zhang, Taolin, et al.
Published: (2026)
by: Zhang, Taolin, et al.
Published: (2026)
AgentReview: Exploring Peer Review Dynamics with LLM Agents
by: Jin, Yiqiao, et al.
Published: (2024)
by: Jin, Yiqiao, et al.
Published: (2024)
Similar Items
-
NPHardEval: Dynamic Benchmark on Reasoning Ability of Large Language Models via Complexity Classes
by: Fan, Lizhou, et al.
Published: (2023) -
War and Peace (WarAgent): Large Language Model-based Multi-Agent Simulation of World Wars
by: Hua, Wenyue, et al.
Published: (2023) -
Disentangling Logic: The Role of Context in Large Language Model Reasoning Capabilities
by: Hua, Wenyue, et al.
Published: (2024) -
BattleAgent: Multi-modal Dynamic Emulation on Historical Battles to Complement Historical Analysis
by: Lin, Shuhang, et al.
Published: (2024) -
Characterizing Online Toxicity During the 2022 Mpox Outbreak: A Computational Analysis of Topical and Network Dynamics
by: Fan, Lizhou, et al.
Published: (2024)