History-Aware Cross-Attention Reinforcement: Self-Supervised Multi Turn and Chain-of-Thought Fine-Tuning with vLLM
Fuente:
arXiv
Salvato in:
| Autori principali: | Kiruluta, Andrew, Lemos, Andreas, Burity, Priscilla |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
Learnable Multi-Scale Wavelet Transformer: A Novel Alternative to Self-Attention
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
Breaking Quadratic Barriers: A Non-Attention LLM for Ultra-Long Context Horizons
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
Spectral Neuro-Symbolic Reasoning II: Semantic Node Merging, Entailment Filtering, and Knowledge Graph Alignment
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
From Eigenmodes to Proofs: Integrating Graph Spectral Operators with Symbolic Interpretable Reasoning
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
Graph Laplacian Wavelet Transformer via Learnable Spectral Decomposition
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
From Pixels and Words to Waves: A Unified Framework for Spectral Dictionary vLLMs
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
Beyond Self Attention: A Subquadratic Fourier Wavelet Transformer with Multi Modal Fusion
di: Kiruluta, Andrew, et al.
Pubblicazione: (2021)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2021)
Beyond Neural Networks: Symbolic Reasoning over Wavelet Logic Graph Signals
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
Operator-Based Machine Intelligence: A Hilbert Space Framework for Spectral Learning and Symbolic Reasoning
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
vLLM Hook v0: A Plug-in for Programming Model Internals on vLLM
di: Ko, Ching-Yun, et al.
Pubblicazione: (2026)
di: Ko, Ching-Yun, et al.
Pubblicazione: (2026)
CS-VLM: Compressed Sensing Attention for Efficient Vision-Language Representation Learning
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
State Fourier Diffusion Language Model (SFDLM): A Scalable, Novel Iterative Approach to Language Modeling
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
Filtering Beats Fine Tuning: A Bayesian Kalman View of In Context Learning in LLMs
di: Kiruluta, Andrew
Pubblicazione: (2026)
di: Kiruluta, Andrew
Pubblicazione: (2026)
Entropic-Time Inference: Self-Organizing Large Language Model Decoding Beyond Attention
di: Kiruluta, Andrew
Pubblicazione: (2026)
di: Kiruluta, Andrew
Pubblicazione: (2026)
Adaptive Two Sided Laplace Transforms: A Learnable, Interpretable, and Scalable Replacement for Self-Attention
di: Kiruluta, Andrew
Pubblicazione: (2025)
di: Kiruluta, Andrew
Pubblicazione: (2025)
From Attention to Atoms: Spectral Dictionary Learning for Fast, Interpretable Language Models
di: Kiruluta, Andrew
Pubblicazione: (2025)
di: Kiruluta, Andrew
Pubblicazione: (2025)
Compressed-Sensing-Guided, Inference-Aware Structured Reduction for Large Language Models
di: Kiruluta, Andrew
Pubblicazione: (2026)
di: Kiruluta, Andrew
Pubblicazione: (2026)
FourierNAT: A Fourier-Mixing-Based Non-Autoregressive Transformer for Parallel Sequence Generation
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)
When to Reason: Semantic Router for vLLM
di: Wang, Chen, et al.
Pubblicazione: (2025)
di: Wang, Chen, et al.
Pubblicazione: (2025)
A Novel Architecture for Symbolic Reasoning with Decision Trees and LLM Agents
di: Kiruluta, Andrew
Pubblicazione: (2025)
di: Kiruluta, Andrew
Pubblicazione: (2025)
ARES: Alternating Reinforcement Learning and Supervised Fine-Tuning for Enhanced Multi-Modal Chain-of-Thought Reasoning Through Diverse AI Feedback
di: Byun, Ju-Seung, et al.
Pubblicazione: (2024)
di: Byun, Ju-Seung, et al.
Pubblicazione: (2024)
On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning
di: Li, Zhaoyi, et al.
Pubblicazione: (2026)
di: Li, Zhaoyi, et al.
Pubblicazione: (2026)
On the Impact of Fine-Tuning on Chain-of-Thought Reasoning
di: Lobo, Elita, et al.
Pubblicazione: (2024)
di: Lobo, Elita, et al.
Pubblicazione: (2024)
98$\times$ Faster LLM Routing Without a Dedicated GPU: Flash Attention, Prompt Compression, and Near-Streaming for the vLLM Semantic Router
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
di: Liu, Xunzhuo, et al.
Pubblicazione: (2026)
Cause-Aware Empathetic Response Generation via Chain-of-Thought Fine-Tuning
di: Chen, Xinhao, et al.
Pubblicazione: (2024)
di: Chen, Xinhao, et al.
Pubblicazione: (2024)
CARFT: Boosting LLM Reasoning via Contrastive Learning with Annotated Chain-of-Thought-based Reinforced Fine-Tuning
di: Zhu, Wenqiao, et al.
Pubblicazione: (2025)
di: Zhu, Wenqiao, et al.
Pubblicazione: (2025)
Data-Driven Variational Basis Learning Beyond Neural Networks: A Non-Neural Framework for Adaptive Basis Discovery
di: Kiruluta, Andrew
Pubblicazione: (2026)
di: Kiruluta, Andrew
Pubblicazione: (2026)
Spectral Generative Flow Models: A Physics-Inspired Replacement for Vectorized Large Language Models
di: Kiruluta, Andrew
Pubblicazione: (2026)
di: Kiruluta, Andrew
Pubblicazione: (2026)
From Gradients to Riccati Geometry: Kalman World Models for Single-Pass Learning
di: Kiruluta, Andrew
Pubblicazione: (2026)
di: Kiruluta, Andrew
Pubblicazione: (2026)
Long-Short Chain-of-Thought Mixture Supervised Fine-Tuning Eliciting Efficient Reasoning in Large Language Models
di: Yu, Bin, et al.
Pubblicazione: (2025)
di: Yu, Bin, et al.
Pubblicazione: (2025)
TRACT: Regression-Aware Fine-tuning Meets Chain-of-Thought Reasoning for LLM-as-a-Judge
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2025)
di: Chiang, Cheng-Han, et al.
Pubblicazione: (2025)
Fine-Tuned Thoughts: Leveraging Chain-of-Thought Reasoning for Industrial Asset Health Monitoring
di: Lin, Shuxin, et al.
Pubblicazione: (2025)
di: Lin, Shuxin, et al.
Pubblicazione: (2025)
Supervised Chain of Thought
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
di: Zhang, Xiang, et al.
Pubblicazione: (2024)
The Impact of Hyperparameters on Large Language Model Inference Performance: An Evaluation of vLLM and HuggingFace Pipelines
di: Martinez, Matias
Pubblicazione: (2024)
di: Martinez, Matias
Pubblicazione: (2024)
Self-Compression of Chain-of-Thought via Multi-Agent Reinforcement Learning
di: Chen, Yiqun, et al.
Pubblicazione: (2026)
di: Chen, Yiqun, et al.
Pubblicazione: (2026)
Beyond Fine-Tuning: In-Context Learning and Chain-of-Thought for Reasoned Distractor Generation
di: Alhazmi, Elaf, et al.
Pubblicazione: (2026)
di: Alhazmi, Elaf, et al.
Pubblicazione: (2026)
Hierarchical Attention Diffusion Networks with Object Priors for Video Change Detection
di: Kiruluta, Andrew, et al.
Pubblicazione: (2024)
di: Kiruluta, Andrew, et al.
Pubblicazione: (2024)
Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning
di: Ning, Yansong, et al.
Pubblicazione: (2025)
di: Ning, Yansong, et al.
Pubblicazione: (2025)
Learning When to Sample: Confidence-Aware Self-Consistency for Efficient LLM Chain-of-Thought Reasoning
di: Xiong, Juming, et al.
Pubblicazione: (2026)
di: Xiong, Juming, et al.
Pubblicazione: (2026)
Documenti analoghi
-
A Self-Supervised Reinforcement Learning Approach for Fine-Tuning Large Language Models Using Cross-Attention Signals
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025) -
Learnable Multi-Scale Wavelet Transformer: A Novel Alternative to Self-Attention
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025) -
Breaking Quadratic Barriers: A Non-Attention LLM for Ultra-Long Context Horizons
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025) -
Spectral Neuro-Symbolic Reasoning II: Semantic Node Merging, Entailment Filtering, and Knowledge Graph Alignment
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025) -
From Eigenmodes to Proofs: Integrating Graph Spectral Operators with Symbolic Interpretable Reasoning
di: Kiruluta, Andrew, et al.
Pubblicazione: (2025)