Automated Circuit Interpretation via Probe Prompting
Fuente:
arXiv
Salvato in:
| Autore principale: | Birardi, Giuseppe |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Domain-Agnostic Neurosymbolic Approach for Big Social Data Analysis: Evaluating Mental Health Sentiment on Social Media during COVID-19
di: Khandelwal, Vedant, et al.
Pubblicazione: (2024)
di: Khandelwal, Vedant, et al.
Pubblicazione: (2024)
SAGE: A Strategy-Aware Graph-Enhanced Generation Framework For Online Counseling
di: Aharon, Eliya Naomi, et al.
Pubblicazione: (2026)
di: Aharon, Eliya Naomi, et al.
Pubblicazione: (2026)
TwinVoice: A Multi-dimensional Benchmark Towards Digital Twins via LLM Persona Simulation
di: Du, Bangde, et al.
Pubblicazione: (2025)
di: Du, Bangde, et al.
Pubblicazione: (2025)
MeMo: Towards Language Models with Associative Memory Mechanisms
di: Zanzotto, Fabio Massimo, et al.
Pubblicazione: (2025)
di: Zanzotto, Fabio Massimo, et al.
Pubblicazione: (2025)
HyperPersona: A Multi-Level Hypergraph Framework for Text-Based Automatic Personality Prediction
di: Heydari, Sina, et al.
Pubblicazione: (2026)
di: Heydari, Sina, et al.
Pubblicazione: (2026)
Aspect-Based Sentiment Analysis for Future Tourism Experiences: A BERT-MoE Framework for Persian User Reviews
di: Taskooh, Hamidreza Kazemi, et al.
Pubblicazione: (2026)
di: Taskooh, Hamidreza Kazemi, et al.
Pubblicazione: (2026)
Learning Natural Language Constraints for Safe Reinforcement Learning of Language Agents
di: Chua, Jaymari, et al.
Pubblicazione: (2025)
di: Chua, Jaymari, et al.
Pubblicazione: (2025)
Gyan: An Explainable Neuro-Symbolic Language Model
di: Srinivasan, Venkat, et al.
Pubblicazione: (2026)
di: Srinivasan, Venkat, et al.
Pubblicazione: (2026)
OntoLogX: Ontology-Guided Knowledge Graph Extraction from Cybersecurity Logs with Large Language Models
di: Cotti, Luca, et al.
Pubblicazione: (2025)
di: Cotti, Luca, et al.
Pubblicazione: (2025)
HIP Network: Historical Information Passing Network for Extrapolation Reasoning on Temporal Knowledge Graph
di: He, Yongquan, et al.
Pubblicazione: (2024)
di: He, Yongquan, et al.
Pubblicazione: (2024)
The Limits of Obliviate: Evaluating Unlearning in LLMs via Stimulus-Knowledge Entanglement-Behavior Framework
di: Shah, Aakriti, et al.
Pubblicazione: (2025)
di: Shah, Aakriti, et al.
Pubblicazione: (2025)
PRISMA: Preference-Reinforced Self-Training Approach for Interpretable Emotionally Intelligent Negotiation Dialogues
di: Kajare, Prajwal Vijay, et al.
Pubblicazione: (2026)
di: Kajare, Prajwal Vijay, et al.
Pubblicazione: (2026)
Study Design and Demystification of Physics Informed Neural Networks for Power Flow Simulation
di: Leyli-abadi, Milad, et al.
Pubblicazione: (2025)
di: Leyli-abadi, Milad, et al.
Pubblicazione: (2025)
A Graph-based RAG for Energy Efficiency Question Answering
di: Campi, Riccardo, et al.
Pubblicazione: (2025)
di: Campi, Riccardo, et al.
Pubblicazione: (2025)
Incentives or Ontology? A Structural Rebuttal to OpenAI's Hallucination Thesis
di: Ackermann, Richard, et al.
Pubblicazione: (2025)
di: Ackermann, Richard, et al.
Pubblicazione: (2025)
Behavioural vs. Representational Systematicity in End-to-End Models: An Opinionated Survey
di: Vegner, Ivan, et al.
Pubblicazione: (2025)
di: Vegner, Ivan, et al.
Pubblicazione: (2025)
The Drill-Down and Fabricate Test (DDFT): A Protocol for Measuring Epistemic Robustness in Language Models
di: Baxi, Rahul
Pubblicazione: (2025)
di: Baxi, Rahul
Pubblicazione: (2025)
Perturbation Dose Responses in Recursive LLM Loops: Raw Switching, Stochastic Floors, and Persistent Escape under Append, Replace, and Dialog Updates
di: Kaplanski, Pawel
Pubblicazione: (2026)
di: Kaplanski, Pawel
Pubblicazione: (2026)
GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
di: Agrawal, Lakshya A, et al.
Pubblicazione: (2025)
di: Agrawal, Lakshya A, et al.
Pubblicazione: (2025)
Graph Language Models
di: Plenz, Moritz, et al.
Pubblicazione: (2024)
di: Plenz, Moritz, et al.
Pubblicazione: (2024)
AI-generated stories favour stability over change: homogeneity and cultural stereotyping in narratives generated by gpt-4o-mini
di: Rettberg, Jill Walker, et al.
Pubblicazione: (2025)
di: Rettberg, Jill Walker, et al.
Pubblicazione: (2025)
propella-1: Multi-Property Document Annotation for LLM Data Curation at Scale
di: Idahl, Maximilian, et al.
Pubblicazione: (2026)
di: Idahl, Maximilian, et al.
Pubblicazione: (2026)
Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies
di: Cotti, Luca, et al.
Pubblicazione: (2025)
di: Cotti, Luca, et al.
Pubblicazione: (2025)
Robustness of Spatio-temporal Graph Neural Networks for Fault Location in Partially Observable Distribution Grids
di: Karabulut, Burak, et al.
Pubblicazione: (2026)
di: Karabulut, Burak, et al.
Pubblicazione: (2026)
MCP: A Control-Theoretic Orchestration Framework for Synergistic Efficiency and Interpretability in Multimodal Large Language Models
di: Zhang, Luyan
Pubblicazione: (2025)
di: Zhang, Luyan
Pubblicazione: (2025)
Tversky Neural Networks: Psychologically Plausible Deep Learning with Differentiable Tversky Similarity
di: Doumbouya, Moussa Koulako Bala, et al.
Pubblicazione: (2025)
di: Doumbouya, Moussa Koulako Bala, et al.
Pubblicazione: (2025)
An Automatic Text Classification Method Based on Hierarchical Taxonomies, Neural Networks and Document Embedding: The NETHIC Tool
di: Lomasto, Luigi, et al.
Pubblicazione: (2026)
di: Lomasto, Luigi, et al.
Pubblicazione: (2026)
LLMs for Game Theory: Entropy-Guided In-Context Learning and Adaptive CoT Reasoning
di: Banfi, Tommaso Felice, et al.
Pubblicazione: (2026)
di: Banfi, Tommaso Felice, et al.
Pubblicazione: (2026)
Entropy-Based Measurement of Value Drift and Alignment Work in Large Language Models
di: Fadli, Samih
Pubblicazione: (2025)
di: Fadli, Samih
Pubblicazione: (2025)
Evo-DKD: Dual-Knowledge Decoding for Autonomous Ontology Evolution in Large Language Models
di: Raman, Vishal, et al.
Pubblicazione: (2025)
di: Raman, Vishal, et al.
Pubblicazione: (2025)
LLM-Rubric: A Multidimensional, Calibrated Approach to Automated Evaluation of Natural Language Texts
di: Hashemi, Helia, et al.
Pubblicazione: (2024)
di: Hashemi, Helia, et al.
Pubblicazione: (2024)
Prompt Readiness Levels (PRL): a maturity scale and scoring framework for production grade prompt assets
di: Guinard, Sebastien
Pubblicazione: (2026)
di: Guinard, Sebastien
Pubblicazione: (2026)
Beyond Deep Learning: Speech Segmentation and Phone Classification with Neural Assemblies
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
di: Adelson, Trevor, et al.
Pubblicazione: (2026)
Enhancing Large Language Models through Neuro-Symbolic Integration and Ontological Reasoning
di: Vsevolodovna, Ruslan Idelfonso Magana, et al.
Pubblicazione: (2025)
di: Vsevolodovna, Ruslan Idelfonso Magana, et al.
Pubblicazione: (2025)
Learning, Fast and Slow: Towards LLMs That Adapt Continually
di: Tiwari, Rishabh, et al.
Pubblicazione: (2026)
di: Tiwari, Rishabh, et al.
Pubblicazione: (2026)
MODP: Multi Objective Directional Prompting
di: Nema, Aashutosh, et al.
Pubblicazione: (2025)
di: Nema, Aashutosh, et al.
Pubblicazione: (2025)
Hopscotch: Discovering and Skipping Redundancies in Language Models
di: Eyceoz, Mustafa, et al.
Pubblicazione: (2025)
di: Eyceoz, Mustafa, et al.
Pubblicazione: (2025)
Induce, Align, Predict: Zero-Shot Stance Detection via Cognitive Inductive Reasoning
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
di: Zhang, Bowen, et al.
Pubblicazione: (2025)
Mitigating Cross-Lingual Cultural Inconsistencies in LLMs via Consensus-Driven Preference Optimisation
di: Resck, Lucas, et al.
Pubblicazione: (2026)
di: Resck, Lucas, et al.
Pubblicazione: (2026)
TRiMS: Real-Time Tracking of Minimal Sufficient Length for Efficient Reasoning via RL
di: Bian, Tingcheng, et al.
Pubblicazione: (2026)
di: Bian, Tingcheng, et al.
Pubblicazione: (2026)
Documenti analoghi
-
A Domain-Agnostic Neurosymbolic Approach for Big Social Data Analysis: Evaluating Mental Health Sentiment on Social Media during COVID-19
di: Khandelwal, Vedant, et al.
Pubblicazione: (2024) -
SAGE: A Strategy-Aware Graph-Enhanced Generation Framework For Online Counseling
di: Aharon, Eliya Naomi, et al.
Pubblicazione: (2026) -
TwinVoice: A Multi-dimensional Benchmark Towards Digital Twins via LLM Persona Simulation
di: Du, Bangde, et al.
Pubblicazione: (2025) -
MeMo: Towards Language Models with Associative Memory Mechanisms
di: Zanzotto, Fabio Massimo, et al.
Pubblicazione: (2025) -
HyperPersona: A Multi-Level Hypergraph Framework for Text-Based Automatic Personality Prediction
di: Heydari, Sina, et al.
Pubblicazione: (2026)