How to Detect and Defeat Molecular Mirage: A Metric-Driven Benchmark for Hallucination in LLM-based Molecular Comprehension
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Hao, Lv, Liuzhenghao, Cao, He, Liu, Zijing, Yan, Zhiyuan, Wang, Yu, Tian, Yonghong, Li, Yu, Yuan, Li |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Navigating Chemical-Linguistic Sharing Space with Heterogeneous Molecular Encoding
par: Lv, Liuzhenghao, et autres
Publié: (2024)
par: Lv, Liuzhenghao, et autres
Publié: (2024)
BioProBench: Comprehensive Dataset and Benchmark in Biological Protocol Understanding and Reasoning
par: Liu, Yuyang, et autres
Publié: (2025)
par: Liu, Yuyang, et autres
Publié: (2025)
Optimal ANN-SNN Conversion with Group Neurons
par: Lv, Liuzhenghao, et autres
Publié: (2024)
par: Lv, Liuzhenghao, et autres
Publié: (2024)
Multi-granularity Score-based Generative Framework Enables Efficient Inverse Design of Complex Organics
par: Chen, Zijun, et autres
Publié: (2024)
par: Chen, Zijun, et autres
Publié: (2024)
Evaluating Evaluation Metrics -- The Mirage of Hallucination Detection
par: Kulkarni, Atharva, et autres
Publié: (2025)
par: Kulkarni, Atharva, et autres
Publié: (2025)
Agentic reinforcement learning empowers next-generation chemical language models for molecular design and synthesis
par: Li, Hao, et autres
Publié: (2026)
par: Li, Hao, et autres
Publié: (2026)
BioProAgent: Neuro-Symbolic Grounding for Constrained Scientific Planning
par: Liu, Yuyang, et autres
Publié: (2026)
par: Liu, Yuyang, et autres
Publié: (2026)
MoleculeQA: A Dataset to Evaluate Factual Accuracy in Molecular Comprehension
par: Lu, Xingyu, et autres
Publié: (2024)
par: Lu, Xingyu, et autres
Publié: (2024)
Beyond Chemical QA: Evaluating LLM's Chemical Reasoning with Modular Chemical Operations
par: Li, Hao, et autres
Publié: (2025)
par: Li, Hao, et autres
Publié: (2025)
TaxDiff: Taxonomic-Guided Diffusion Model for Protein Sequence Generation
par: Zongying, Lin, et autres
Publié: (2024)
par: Zongying, Lin, et autres
Publié: (2024)
ProLLaMA: A Protein Large Language Model for Multi-Task Protein Language Processing
par: Lv, Liuzhenghao, et autres
Publié: (2024)
par: Lv, Liuzhenghao, et autres
Publié: (2024)
InstructMol: Multi-Modal Integration for Building a Versatile and Reliable Molecular Assistant in Drug Discovery
par: Cao, He, et autres
Publié: (2023)
par: Cao, He, et autres
Publié: (2023)
Rethinking Text-based Protein Understanding: Retrieval or LLM?
par: Wu, Juntong, et autres
Publié: (2025)
par: Wu, Juntong, et autres
Publié: (2025)
SubGDiff: A Subgraph Diffusion Model to Improve Molecular Representation Learning
par: Zhang, Jiying, et autres
Publié: (2024)
par: Zhang, Jiying, et autres
Publié: (2024)
SMILES-Prompting: A Novel Approach to LLM Jailbreak Attacks in Chemical Synthesis
par: Wong, Aidan, et autres
Publié: (2024)
par: Wong, Aidan, et autres
Publié: (2024)
AgentHallu: Benchmarking Automated Hallucination Attribution of LLM-based Agents
par: Liu, Xuannan, et autres
Publié: (2026)
par: Liu, Xuannan, et autres
Publié: (2026)
PRESTO: Progressive Pretraining Enhances Synthetic Chemistry Outcomes
par: Cao, He, et autres
Publié: (2024)
par: Cao, He, et autres
Publié: (2024)
Eutectic Gallium–Indium in Fabricating and Integrating Molecular Devices
par: Yu Xie, et autres
Publié: (2025)
par: Yu Xie, et autres
Publié: (2025)
AgentRecBench: Benchmarking LLM Agent-based Personalized Recommender Systems
par: Shang, Yu, et autres
Publié: (2025)
par: Shang, Yu, et autres
Publié: (2025)
MoleCode unlocks structural intelligence in large language models
par: Yan, Zhiyuan, et autres
Publié: (2026)
par: Yan, Zhiyuan, et autres
Publié: (2026)
Profit Mirage: Revisiting Information Leakage in LLM-based Financial Agents
par: Li, Xiangyu, et autres
Publié: (2025)
par: Li, Xiangyu, et autres
Publié: (2025)
AttriGuard: Defeating Indirect Prompt Injection in LLM Agents via Causal Attribution of Tool Invocations
par: He, Yu, et autres
Publié: (2026)
par: He, Yu, et autres
Publié: (2026)
From Static Structures to Ensembles: Studying and Harnessing Protein Structure Tokenization
par: Liu, Zijing, et autres
Publié: (2025)
par: Liu, Zijing, et autres
Publié: (2025)
GPT-ImgEval: A Comprehensive Benchmark for Diagnosing GPT4o in Image Generation
par: Yan, Zhiyuan, et autres
Publié: (2025)
par: Yan, Zhiyuan, et autres
Publié: (2025)
The Clever Hans Mirage: A Comprehensive Survey on Spurious Correlations in Machine Learning
par: Ye, Wenqian, et autres
Publié: (2024)
par: Ye, Wenqian, et autres
Publié: (2024)
Machine Mindset: An MBTI Exploration of Large Language Models
par: Cui, Jiaxi, et autres
Publié: (2023)
par: Cui, Jiaxi, et autres
Publié: (2023)
The Mirage of Performance Gains: Why Contrastive Decoding Fails to Mitigate Object Hallucinations in MLLMs?
par: Yin, Hao, et autres
Publié: (2025)
par: Yin, Hao, et autres
Publié: (2025)
A High‐Throughput Screening Strategy for Synthesizing Molecularly Imprinted Polymer Nanoparticles Selectively Targeting Tumors
par: Qingmei Song, et autres
Publié: (2024)
par: Qingmei Song, et autres
Publié: (2024)
BinMetric: A Comprehensive Binary Analysis Benchmark for Large Language Models
par: Shang, Xiuwei, et autres
Publié: (2025)
par: Shang, Xiuwei, et autres
Publié: (2025)
LLM Hallucination Detection: HSAD
par: Li, JinXin, et autres
Publié: (2025)
par: Li, JinXin, et autres
Publié: (2025)
Verb Mirage: Unveiling and Assessing Verb Concept Hallucinations in Multimodal Large Language Models
par: Wang, Zehao, et autres
Publié: (2024)
par: Wang, Zehao, et autres
Publié: (2024)
Semiclassical Nonadiabatic Molecular Dynamics for Molecular Exciton-Polaritons
par: Li, Xinyang, et autres
Publié: (2024)
par: Li, Xinyang, et autres
Publié: (2024)
Towards a Comprehensive Benchmark for Pathological Lymph Node Metastasis in Breast Cancer Sections
par: Ling, Xitong, et autres
Publié: (2024)
par: Ling, Xitong, et autres
Publié: (2024)
NMRGym: A Comprehensive Benchmark for Nuclear Magnetic Resonance Based Molecular Structure Elucidation
par: Fang, Zheng, et autres
Publié: (2026)
par: Fang, Zheng, et autres
Publié: (2026)
CodeMirage: Hallucinations in Code Generated by Large Language Models
par: Agarwal, Vibhor, et autres
Publié: (2024)
par: Agarwal, Vibhor, et autres
Publié: (2024)
How HIV Defeats the Immune System
Publié: (1995)
Publié: (1995)
Mozi: Governed Autonomy for Drug Discovery LLM Agents
par: Cao, He, et autres
Publié: (2026)
par: Cao, He, et autres
Publié: (2026)
A New Non-Binary Response Generation Scheme from Physical Unclonable Functions
par: Bai, Yonghong, et autres
Publié: (2024)
par: Bai, Yonghong, et autres
Publié: (2024)
TurnaboutLLM: A Deductive Reasoning Benchmark from Detective Games
par: Yuan, Yuan, et autres
Publié: (2025)
par: Yuan, Yuan, et autres
Publié: (2025)
MUBen: Benchmarking the Uncertainty of Molecular Representation Models
par: Li, Yinghao, et autres
Publié: (2023)
par: Li, Yinghao, et autres
Publié: (2023)
Documents similaires
-
Navigating Chemical-Linguistic Sharing Space with Heterogeneous Molecular Encoding
par: Lv, Liuzhenghao, et autres
Publié: (2024) -
BioProBench: Comprehensive Dataset and Benchmark in Biological Protocol Understanding and Reasoning
par: Liu, Yuyang, et autres
Publié: (2025) -
Optimal ANN-SNN Conversion with Group Neurons
par: Lv, Liuzhenghao, et autres
Publié: (2024) -
Multi-granularity Score-based Generative Framework Enables Efficient Inverse Design of Complex Organics
par: Chen, Zijun, et autres
Publié: (2024) -
Evaluating Evaluation Metrics -- The Mirage of Hallucination Detection
par: Kulkarni, Atharva, et autres
Publié: (2025)