Are Large Language Models Reliable AI Scientists? Assessing Reverse-Engineering of Black-Box Systems
Fuente:
arXiv
Saved in:
| Main Authors: | Geng, Jiayi, Chen, Howard, Arumugam, Dilip, Griffiths, Thomas L. |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Toward Efficient Exploration by Large Language Model Agents
by: Arumugam, Dilip, et al.
Published: (2025)
by: Arumugam, Dilip, et al.
Published: (2025)
Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions
by: Zhu, Jian-Qiao, et al.
Published: (2025)
by: Zhu, Jian-Qiao, et al.
Published: (2025)
Large Language Models Assume People are More Rational than We Really are
by: Liu, Ryan, et al.
Published: (2024)
by: Liu, Ryan, et al.
Published: (2024)
Cognitive Models and AI Algorithms Provide Templates for Designing Language Agents
by: Liu, Ryan, et al.
Published: (2026)
by: Liu, Ryan, et al.
Published: (2026)
Accumulating Context Changes the Beliefs of Language Models
by: Geng, Jiayi, et al.
Published: (2025)
by: Geng, Jiayi, et al.
Published: (2025)
BBox-Adapter: Lightweight Adapting for Black-Box Large Language Models
by: Sun, Haotian, et al.
Published: (2024)
by: Sun, Haotian, et al.
Published: (2024)
Large Language Model Confidence Estimation via Black-Box Access
by: Pedapati, Tejaswini, et al.
Published: (2024)
by: Pedapati, Tejaswini, et al.
Published: (2024)
RE-Adapt: Reverse Engineered Adaptation of Large Language Models
by: Fleshman, William, et al.
Published: (2024)
by: Fleshman, William, et al.
Published: (2024)
Black-Box Reliability Certification for AI Agents via Self-Consistency Sampling and Conformal Calibration
by: Mouzouni, Charafeddine
Published: (2026)
by: Mouzouni, Charafeddine
Published: (2026)
How do Large Language Models Navigate Conflicts between Honesty and Helpfulness?
by: Liu, Ryan, et al.
Published: (2024)
by: Liu, Ryan, et al.
Published: (2024)
Rational Metareasoning for Large Language Models
by: De Sabbata, C. Nicolò, et al.
Published: (2024)
by: De Sabbata, C. Nicolò, et al.
Published: (2024)
Are Large Language Models Sensitive to the Motives Behind Communication?
by: Wu, Addison J., et al.
Published: (2025)
by: Wu, Addison J., et al.
Published: (2025)
The AI Data Scientist
by: Akimov, Farkhad, et al.
Published: (2025)
by: Akimov, Farkhad, et al.
Published: (2025)
Efficient Non-Parametric Uncertainty Quantification for Black-Box Large Language Models and Decision Planning
by: Tsai, Yao-Hung Hubert, et al.
Published: (2024)
by: Tsai, Yao-Hung Hubert, et al.
Published: (2024)
PAL: Proxy-Guided Black-Box Attack on Large Language Models
by: Sitawarin, Chawin, et al.
Published: (2024)
by: Sitawarin, Chawin, et al.
Published: (2024)
Machine Bullshit: Characterizing the Emergent Disregard for Truth in Large Language Models
by: Liang, Kaiqu, et al.
Published: (2025)
by: Liang, Kaiqu, et al.
Published: (2025)
Uncertainty Quantification for Language Models: A Suite of Black-Box, White-Box, LLM Judge, and Ensemble Scorers
by: Bouchard, Dylan, et al.
Published: (2025)
by: Bouchard, Dylan, et al.
Published: (2025)
Incoherent Probability Judgments in Large Language Models
by: Zhu, Jian-Qiao, et al.
Published: (2024)
by: Zhu, Jian-Qiao, et al.
Published: (2024)
Identifying and Mitigating the Influence of the Prior Distribution in Large Language Models
by: Zhang, Liyi, et al.
Published: (2025)
by: Zhang, Liyi, et al.
Published: (2025)
Black-Box On-Policy Distillation of Large Language Models
by: Ye, Tianzhu, et al.
Published: (2025)
by: Ye, Tianzhu, et al.
Published: (2025)
Mind Your Step (by Step): Chain-of-Thought can Reduce Performance on Tasks where Thinking Makes Humans Worse
by: Liu, Ryan, et al.
Published: (2024)
by: Liu, Ryan, et al.
Published: (2024)
Emergent Semantic Role Understanding in Language Models
by: Griffiths, Carla, et al.
Published: (2026)
by: Griffiths, Carla, et al.
Published: (2026)
Improving the Efficiency of Language Agent Teams with Adaptive Task Graphs
by: Mieczkowski, Elizabeth, et al.
Published: (2026)
by: Mieczkowski, Elizabeth, et al.
Published: (2026)
AI Scientists Fail Without Strong Implementation Capability
by: Zhu, Minjun, et al.
Published: (2025)
by: Zhu, Minjun, et al.
Published: (2025)
Levels of Analysis for Large Language Models
by: Ku, Alexander Y., et al.
Published: (2025)
by: Ku, Alexander Y., et al.
Published: (2025)
In-Context Explainers: Harnessing LLMs for Explaining Black Box Models
by: Kroeger, Nicholas, et al.
Published: (2023)
by: Kroeger, Nicholas, et al.
Published: (2023)
HYDRA: Model Factorization Framework for Black-Box LLM Personalization
by: Zhuang, Yuchen, et al.
Published: (2024)
by: Zhuang, Yuchen, et al.
Published: (2024)
AiraXiv: An AI-Driven Open-Access Platform for Human and AI Scientists
by: Pan, Junshu, et al.
Published: (2026)
by: Pan, Junshu, et al.
Published: (2026)
BlackDAN: A Black-Box Multi-Objective Approach for Effective and Contextual Jailbreaking of Large Language Models
by: Wang, Xinyuan, et al.
Published: (2024)
by: Wang, Xinyuan, et al.
Published: (2024)
Reverse-Engineering the Reader
by: Kiegeland, Samuel, et al.
Published: (2024)
by: Kiegeland, Samuel, et al.
Published: (2024)
Training Large Language Models for Reasoning through Reverse Curriculum Reinforcement Learning
by: Xi, Zhiheng, et al.
Published: (2024)
by: Xi, Zhiheng, et al.
Published: (2024)
Towards a More Inclusive AI: Progress and Perspectives in Large Language Model Training for the Sámi Language
by: Paul, Ronny, et al.
Published: (2024)
by: Paul, Ronny, et al.
Published: (2024)
Mafin: Enhancing Black-Box Embeddings with Model Augmented Fine-Tuning
by: Zhang, Mingtian, et al.
Published: (2024)
by: Zhang, Mingtian, et al.
Published: (2024)
Fast Large Language Model Collaborative Decoding via Speculation
by: Fu, Jiale, et al.
Published: (2025)
by: Fu, Jiale, et al.
Published: (2025)
Assessing Large Language Models on Climate Information
by: Bulian, Jannis, et al.
Published: (2023)
by: Bulian, Jannis, et al.
Published: (2023)
The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery
by: Lu, Chris, et al.
Published: (2024)
by: Lu, Chris, et al.
Published: (2024)
Memory Tokens: Large Language Models Can Generate Reversible Sentence Embeddings
by: Sastre, Ignacio, et al.
Published: (2025)
by: Sastre, Ignacio, et al.
Published: (2025)
Steering Risk Preferences in Large Language Models by Aligning Behavioral and Neural Representations
by: Zhu, Jian-Qiao, et al.
Published: (2025)
by: Zhu, Jian-Qiao, et al.
Published: (2025)
Knowledge Editing on Black-box Large Language Models
by: Song, Xiaoshuai, et al.
Published: (2024)
by: Song, Xiaoshuai, et al.
Published: (2024)
Markovian Generation Chains in Large Language Models
by: Geng, Mingmeng, et al.
Published: (2026)
by: Geng, Mingmeng, et al.
Published: (2026)
Similar Items
-
Toward Efficient Exploration by Large Language Model Agents
by: Arumugam, Dilip, et al.
Published: (2025) -
Using Reinforcement Learning to Train Large Language Models to Explain Human Decisions
by: Zhu, Jian-Qiao, et al.
Published: (2025) -
Large Language Models Assume People are More Rational than We Really are
by: Liu, Ryan, et al.
Published: (2024) -
Cognitive Models and AI Algorithms Provide Templates for Designing Language Agents
by: Liu, Ryan, et al.
Published: (2026) -
Accumulating Context Changes the Beliefs of Language Models
by: Geng, Jiayi, et al.
Published: (2025)