Identifying the Risks of LM Agents with an LM-Emulated Sandbox
Fuente:
arXiv
Saved in:
| Main Authors: | Ruan, Yangjun, Dong, Honghua, Wang, Andrew, Pitis, Silviu, Zhou, Yongchao, Ba, Jimmy, Dubois, Yann, Maddison, Chris J., Hashimoto, Tatsunori |
|---|---|
| Format: | Preprint |
| Published: |
2023
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
LM Agents May Fail to Act on Their Own Risk Knowledge
by: Tang, Yuzhi, et al.
Published: (2025)
by: Tang, Yuzhi, et al.
Published: (2025)
Observational Scaling Laws and the Predictability of Language Model Performance
by: Ruan, Yangjun, et al.
Published: (2024)
by: Ruan, Yangjun, et al.
Published: (2024)
Reasoning to Learn from Latent Thoughts
by: Ruan, Yangjun, et al.
Published: (2025)
by: Ruan, Yangjun, et al.
Published: (2025)
APPL: A Prompt Programming Language for Harmonious Integration of Programs and Large Language Model Prompts
by: Dong, Honghua, et al.
Published: (2024)
by: Dong, Honghua, et al.
Published: (2024)
Report Cards: Qualitative Evaluation of Language Models Using Natural Language Summaries
by: Yang, Blair, et al.
Published: (2024)
by: Yang, Blair, et al.
Published: (2024)
Graph-based Uncertainty Metrics for Long-form Language Model Outputs
by: Jiang, Mingjian, et al.
Published: (2024)
by: Jiang, Mingjian, et al.
Published: (2024)
Evaluating Self-Supervised Learning via Risk Decomposition
by: Dubois, Yann, et al.
Published: (2023)
by: Dubois, Yann, et al.
Published: (2023)
Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators
by: Dubois, Yann, et al.
Published: (2024)
by: Dubois, Yann, et al.
Published: (2024)
AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback
by: Dubois, Yann, et al.
Published: (2023)
by: Dubois, Yann, et al.
Published: (2023)
Putting It All into Context: Simplifying Agents with LCLMs
by: Jiang, Mingjian, et al.
Published: (2025)
by: Jiang, Mingjian, et al.
Published: (2025)
Improving Context-Aware Preference Modeling for Language Models
by: Pitis, Silviu, et al.
Published: (2024)
by: Pitis, Silviu, et al.
Published: (2024)
LM Agents for Coordinating Multi-User Information Gathering
by: Jhamtani, Harsh, et al.
Published: (2025)
by: Jhamtani, Harsh, et al.
Published: (2025)
Xmodel-LM Technical Report
by: Wang, Yichuan, et al.
Published: (2024)
by: Wang, Yichuan, et al.
Published: (2024)
LM-SPT: LM-Aligned Semantic Distillation for Speech Tokenization
by: Jo, Daejin, et al.
Published: (2025)
by: Jo, Daejin, et al.
Published: (2025)
InternLM2 Technical Report
by: Cai, Zheng, et al.
Published: (2024)
by: Cai, Zheng, et al.
Published: (2024)
LM2: Large Memory Models
by: Kang, Jikun, et al.
Published: (2025)
by: Kang, Jikun, et al.
Published: (2025)
PulseLM: A Foundation Dataset and Benchmark for PPG-Text Learning
by: Pham, Hung Manh, et al.
Published: (2026)
by: Pham, Hung Manh, et al.
Published: (2026)
Language Models with Conformal Factuality Guarantees
by: Mohri, Christopher, et al.
Published: (2024)
by: Mohri, Christopher, et al.
Published: (2024)
IMPersona: Evaluating Individual Level LM Impersonation
by: Shi, Quan, et al.
Published: (2025)
by: Shi, Quan, et al.
Published: (2025)
IntroLM: Introspective Language Models via Prefilling-Time Self-Evaluation
by: Kasnavieh, Hossein Hosseini, et al.
Published: (2026)
by: Kasnavieh, Hossein Hosseini, et al.
Published: (2026)
Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting
by: Hu, Michael Y., et al.
Published: (2025)
by: Hu, Michael Y., et al.
Published: (2025)
LP-LM: No Hallucinations in Question Answering with Logic Programming
by: Wu, Katherine, et al.
Published: (2025)
by: Wu, Katherine, et al.
Published: (2025)
Benchmarking Distributional Alignment of Large Language Models
by: Meister, Nicole, et al.
Published: (2024)
by: Meister, Nicole, et al.
Published: (2024)
MachineLearningLM: Scaling Many-shot In-context Learning via Continued Pretraining
by: Dong, Haoyu, et al.
Published: (2025)
by: Dong, Haoyu, et al.
Published: (2025)
SensorLM: Learning the Language of Wearable Sensors
by: Zhang, Yuwei, et al.
Published: (2025)
by: Zhang, Yuwei, et al.
Published: (2025)
CogLM: Tracking Cognitive Development of Large Language Models
by: Wang, Xinglin, et al.
Published: (2024)
by: Wang, Xinglin, et al.
Published: (2024)
How does a Multilingual LM Handle Multiple Languages?
by: Kakarla, Santhosh, et al.
Published: (2025)
by: Kakarla, Santhosh, et al.
Published: (2025)
PonderLM: Pretraining Language Models to Ponder in Continuous Space
by: Zeng, Boyi, et al.
Published: (2025)
by: Zeng, Boyi, et al.
Published: (2025)
Anti-LM Decoding for Zero-shot In-context Machine Translation
by: Sia, Suzanna, et al.
Published: (2023)
by: Sia, Suzanna, et al.
Published: (2023)
CataLM: Empowering Catalyst Design Through Large Language Models
by: Wang, Ludi, et al.
Published: (2024)
by: Wang, Ludi, et al.
Published: (2024)
Test-Time Fairness and Robustness in Large Language Models
by: Cotta, Leonardo, et al.
Published: (2024)
by: Cotta, Leonardo, et al.
Published: (2024)
ArXiv-to-Model: A Practical Study of Scientific LM Training
by: Gupta, Anuj
Published: (2026)
by: Gupta, Anuj
Published: (2026)
UrduLM: A Resource-Efficient Monolingual Urdu Language Model
by: Ali, Syed Muhammad, et al.
Published: (2026)
by: Ali, Syed Muhammad, et al.
Published: (2026)
SudoLM: Learning Access Control of Parametric Knowledge with Authorization Alignment
by: Liu, Qin, et al.
Published: (2024)
by: Liu, Qin, et al.
Published: (2024)
JudgeLM: Fine-tuned Large Language Models are Scalable Judges
by: Zhu, Lianghui, et al.
Published: (2023)
by: Zhu, Lianghui, et al.
Published: (2023)
PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization
by: Wang, Yidong, et al.
Published: (2023)
by: Wang, Yidong, et al.
Published: (2023)
Demographic Attributes Prediction from Speech Using WavLM Embeddings
by: Yang, Yuchen, et al.
Published: (2025)
by: Yang, Yuchen, et al.
Published: (2025)
HumanLM: Simulating Users with State Alignment Beats Response Imitation
by: Wu, Shirley, et al.
Published: (2026)
by: Wu, Shirley, et al.
Published: (2026)
REFINE-LM: Mitigating Language Model Stereotypes via Reinforcement Learning
by: Qureshi, Rameez, et al.
Published: (2024)
by: Qureshi, Rameez, et al.
Published: (2024)
Simulating Viva Voce Examinations to Evaluate Clinical Reasoning in Large Language Models
by: Chiu, Christopher, et al.
Published: (2025)
by: Chiu, Christopher, et al.
Published: (2025)
Similar Items
-
LM Agents May Fail to Act on Their Own Risk Knowledge
by: Tang, Yuzhi, et al.
Published: (2025) -
Observational Scaling Laws and the Predictability of Language Model Performance
by: Ruan, Yangjun, et al.
Published: (2024) -
Reasoning to Learn from Latent Thoughts
by: Ruan, Yangjun, et al.
Published: (2025) -
APPL: A Prompt Programming Language for Harmonious Integration of Programs and Large Language Model Prompts
by: Dong, Honghua, et al.
Published: (2024) -
Report Cards: Qualitative Evaluation of Language Models Using Natural Language Summaries
by: Yang, Blair, et al.
Published: (2024)