Propensity Inference: Environmental Contributors to LLM Behaviour
Fuente:
arXiv
Salvato in:
| Autori principali: | Järviniemi, Olli, Makins, Oliver, Merizian, Jacob, Kirk, Robert, Millwood, Ben |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Uncovering Deceptive Tendencies in Language Models: A Simulated Company AI Assistant
di: Järviniemi, Olli, et al.
Pubblicazione: (2024)
di: Järviniemi, Olli, et al.
Pubblicazione: (2024)
Subversion via Focal Points: Investigating Collusion in LLM Monitoring
di: Järviniemi, Olli
Pubblicazione: (2025)
di: Järviniemi, Olli
Pubblicazione: (2025)
Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution
di: Dineen, Jacob, et al.
Pubblicazione: (2026)
di: Dineen, Jacob, et al.
Pubblicazione: (2026)
SafeCtrl-RL: Inference-Time Adaptive Behaviour Control for LLM Dialogue via RL-Driven Prompt Optimisation
di: Orme, Michael, et al.
Pubblicazione: (2026)
di: Orme, Michael, et al.
Pubblicazione: (2026)
The Knowledge-Behaviour Disconnect in LLM-based Chatbots
di: Broersen, Jan
Pubblicazione: (2025)
di: Broersen, Jan
Pubblicazione: (2025)
XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models
di: Röttger, Paul, et al.
Pubblicazione: (2023)
di: Röttger, Paul, et al.
Pubblicazione: (2023)
Investigating Non-Transitivity in LLM-as-a-Judge
di: Xu, Yi, et al.
Pubblicazione: (2025)
di: Xu, Yi, et al.
Pubblicazione: (2025)
UK AISI Alignment Evaluation Case-Study
di: Souly, Alexandra, et al.
Pubblicazione: (2026)
di: Souly, Alexandra, et al.
Pubblicazione: (2026)
CHIMERA: Compact Synthetic Data for Generalizable LLM Reasoning
di: Zhu, Xinyu, et al.
Pubblicazione: (2026)
di: Zhu, Xinyu, et al.
Pubblicazione: (2026)
Communication Compression for Tensor Parallel LLM Inference
di: Hansen-Palmus, Jan, et al.
Pubblicazione: (2024)
di: Hansen-Palmus, Jan, et al.
Pubblicazione: (2024)
PRAIB: Peer Review AI Benchmark of Behaviour of LLM-Assisted Reviewing
di: Żurawicki, Krzysztof, et al.
Pubblicazione: (2026)
di: Żurawicki, Krzysztof, et al.
Pubblicazione: (2026)
STACK: Adversarial Attacks on LLM Safeguard Pipelines
di: McKenzie, Ian R., et al.
Pubblicazione: (2025)
di: McKenzie, Ian R., et al.
Pubblicazione: (2025)
Next Token Knowledge Tracing: Exploiting Pretrained LLM Representations to Decode Student Behaviour
di: Norris, Max, et al.
Pubblicazione: (2025)
di: Norris, Max, et al.
Pubblicazione: (2025)
Refusal Steering: Fine-grained Control over LLM Refusal Behaviour for Sensitive Topics
di: García-Ferrero, Iker, et al.
Pubblicazione: (2025)
di: García-Ferrero, Iker, et al.
Pubblicazione: (2025)
AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents
di: Naik, Akshat, et al.
Pubblicazione: (2025)
di: Naik, Akshat, et al.
Pubblicazione: (2025)
Dataset Featurization: Uncovering Natural Language Features through Unsupervised Data Reconstruction
di: Bravansky, Michal, et al.
Pubblicazione: (2025)
di: Bravansky, Michal, et al.
Pubblicazione: (2025)
NITRO: LLM Inference on Intel Laptop NPUs
di: Fei, Anthony, et al.
Pubblicazione: (2024)
di: Fei, Anthony, et al.
Pubblicazione: (2024)
Simulation, Modelling and Classification of Wiki Contributors: Spotting The Good, The Bad, and The Ugly
di: Méndez, Silvia García, et al.
Pubblicazione: (2024)
di: Méndez, Silvia García, et al.
Pubblicazione: (2024)
Understanding the Effects of RLHF on LLM Generalisation and Diversity
di: Kirk, Robert, et al.
Pubblicazione: (2023)
di: Kirk, Robert, et al.
Pubblicazione: (2023)
LLM Inference Unveiled: Survey and Roofline Model Insights
di: Yuan, Zhihang, et al.
Pubblicazione: (2024)
di: Yuan, Zhihang, et al.
Pubblicazione: (2024)
Scaling LLM Inference with Optimized Sample Compute Allocation
di: Zhang, Kexun, et al.
Pubblicazione: (2024)
di: Zhang, Kexun, et al.
Pubblicazione: (2024)
LLM-based Translation Inference with Iterative Bilingual Understanding
di: Chen, Andong, et al.
Pubblicazione: (2024)
di: Chen, Andong, et al.
Pubblicazione: (2024)
Plausibility Vaccine: Injecting LLM Knowledge for Event Plausibility
di: Chmura, Jacob, et al.
Pubblicazione: (2025)
di: Chmura, Jacob, et al.
Pubblicazione: (2025)
GroundAct: Can LLM Agents Ground Actions in Environmental States?
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
di: Wang, Zixuan, et al.
Pubblicazione: (2025)
CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference
di: Liu, Dong, et al.
Pubblicazione: (2025)
di: Liu, Dong, et al.
Pubblicazione: (2025)
Codebook-Injected Dialogue Segmentation for Multi-Utterance Constructs Annotation: LLM-Assisted and Gold-Label-Free Evaluation
di: Lee, Jinsook, et al.
Pubblicazione: (2026)
di: Lee, Jinsook, et al.
Pubblicazione: (2026)
EvoP: Robust LLM Inference via Evolutionary Pruning
di: Wu, Shangyu, et al.
Pubblicazione: (2025)
di: Wu, Shangyu, et al.
Pubblicazione: (2025)
Reward Model Overoptimisation in Iterated RLHF
di: Wolf, Lorenz, et al.
Pubblicazione: (2025)
di: Wolf, Lorenz, et al.
Pubblicazione: (2025)
Reformulating KV Cache Eviction Problem for Long-Context LLM Inference
di: Mai, Tho, et al.
Pubblicazione: (2026)
di: Mai, Tho, et al.
Pubblicazione: (2026)
XC-Cache: Cross-Attending to Cached Context for Efficient LLM Inference
di: Monteiro, João, et al.
Pubblicazione: (2024)
di: Monteiro, João, et al.
Pubblicazione: (2024)
FLRC: Fine-grained Low-Rank Compressor for Efficient LLM Inference
di: Lu, Yu-Chen, et al.
Pubblicazione: (2025)
di: Lu, Yu-Chen, et al.
Pubblicazione: (2025)
ChunkLLM: A Lightweight Pluggable Framework for Accelerating LLMs Inference
di: Ouyang, Haojie, et al.
Pubblicazione: (2025)
di: Ouyang, Haojie, et al.
Pubblicazione: (2025)
Amphista: Bi-directional Multi-head Decoding for Accelerating LLM Inference
di: Li, Zeping, et al.
Pubblicazione: (2024)
di: Li, Zeping, et al.
Pubblicazione: (2024)
AutoManual: Constructing Instruction Manuals by LLM Agents via Interactive Environmental Learning
di: Chen, Minghao, et al.
Pubblicazione: (2024)
di: Chen, Minghao, et al.
Pubblicazione: (2024)
Datarus-R1: An Adaptive Multi-Step Reasoning LLM for Automated Data Analysis
di: Chaliah, Ayoub Ben, et al.
Pubblicazione: (2025)
di: Chaliah, Ayoub Ben, et al.
Pubblicazione: (2025)
Faithfulness metric fusion: Improving the evaluation of LLM trustworthiness across domains
di: Malin, Ben, et al.
Pubblicazione: (2025)
di: Malin, Ben, et al.
Pubblicazione: (2025)
Exploring the Knowledge Mismatch Hypothesis: Hallucination Propensity in Small Models Fine-tuned on Data from Larger Models
di: Wee, Phil, et al.
Pubblicazione: (2024)
di: Wee, Phil, et al.
Pubblicazione: (2024)
AdaSkip: Adaptive Sublayer Skipping for Accelerating Long-Context LLM Inference
di: He, Zhuomin, et al.
Pubblicazione: (2025)
di: He, Zhuomin, et al.
Pubblicazione: (2025)
Beyond Behavioural Trade-Offs: Mechanistic Tracing of Pain-Pleasure Decisions in an LLM
di: Bianco, Francesca, et al.
Pubblicazione: (2026)
di: Bianco, Francesca, et al.
Pubblicazione: (2026)
Performance Characterization of Expert Router for Scalable LLM Inference
di: Pichlmeier, Josef, et al.
Pubblicazione: (2024)
di: Pichlmeier, Josef, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Uncovering Deceptive Tendencies in Language Models: A Simulated Company AI Assistant
di: Järviniemi, Olli, et al.
Pubblicazione: (2024) -
Subversion via Focal Points: Investigating Collusion in LLM Monitoring
di: Järviniemi, Olli
Pubblicazione: (2025) -
Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution
di: Dineen, Jacob, et al.
Pubblicazione: (2026) -
SafeCtrl-RL: Inference-Time Adaptive Behaviour Control for LLM Dialogue via RL-Driven Prompt Optimisation
di: Orme, Michael, et al.
Pubblicazione: (2026) -
The Knowledge-Behaviour Disconnect in LLM-based Chatbots
di: Broersen, Jan
Pubblicazione: (2025)