PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization
Fuente:
arXiv
Guardado en:
| Autores principales: | Banerjee, Adhiraj, Arora, Vipul |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents
por: Banerjee, Adhiraj, et al.
Publicado: (2025)
por: Banerjee, Adhiraj, et al.
Publicado: (2025)
WavLink: Compact Audio-Text Embeddings with a Global Whisper Token
por: Kumar, Gokul Karthik, et al.
Publicado: (2026)
por: Kumar, Gokul Karthik, et al.
Publicado: (2026)
Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization
por: Fang, Zheng, et al.
Publicado: (2026)
por: Fang, Zheng, et al.
Publicado: (2026)
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
por: Kim, Jongsuk, et al.
Publicado: (2024)
por: Kim, Jongsuk, et al.
Publicado: (2024)
TokenChain: A Discrete Speech Chain via Semantic Token Modeling
por: Wang, Mingxuan, et al.
Publicado: (2025)
por: Wang, Mingxuan, et al.
Publicado: (2025)
AlignAtt: Using Attention-based Audio-Translation Alignments as a Guide for Simultaneous Speech Translation
por: Papi, Sara, et al.
Publicado: (2023)
por: Papi, Sara, et al.
Publicado: (2023)
PAST: Phonetic-Acoustic Speech Tokenizer
por: Har-Tuv, Nadav, et al.
Publicado: (2025)
por: Har-Tuv, Nadav, et al.
Publicado: (2025)
Decoding the Ear: A Framework for Objectifying Expressiveness from Human Preference Through Efficient Alignment
por: Lin, Zhiyu, et al.
Publicado: (2025)
por: Lin, Zhiyu, et al.
Publicado: (2025)
Utilizing Neural Transducers for Two-Stage Text-to-Speech via Semantic Token Prediction
por: Kim, Minchan, et al.
Publicado: (2024)
por: Kim, Minchan, et al.
Publicado: (2024)
Token-Weighted RNN-T for Learning from Flawed Data
por: Keren, Gil, et al.
Publicado: (2024)
por: Keren, Gil, et al.
Publicado: (2024)
Exploring Token-Space Manipulation in Latent Audio Tokenizers
por: Paissan, Francesco, et al.
Publicado: (2026)
por: Paissan, Francesco, et al.
Publicado: (2026)
DC-Spin: A Speaker-invariant Speech Tokenizer for Spoken Language Models
por: Chang, Heng-Jui, et al.
Publicado: (2024)
por: Chang, Heng-Jui, et al.
Publicado: (2024)
AQAScore: Evaluating Semantic Alignment in Text-to-Audio Generation via Audio Question Answering
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
por: Kuan, Chun-Yi, et al.
Publicado: (2026)
UALM: Unified Audio Language Model for Understanding, Generation and Reasoning
por: Tian, Jinchuan, et al.
Publicado: (2025)
por: Tian, Jinchuan, et al.
Publicado: (2025)
Assessing Factual Music Comprehension in Large Audio Language Models
por: Lin, Daniel Chenyu, et al.
Publicado: (2025)
por: Lin, Daniel Chenyu, et al.
Publicado: (2025)
Audio MultiChallenge: A Multi-Turn Evaluation of Spoken Dialogue Systems on Natural Human Interaction
por: Gosai, Advait, et al.
Publicado: (2025)
por: Gosai, Advait, et al.
Publicado: (2025)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
por: Kuan, Chun-Yi, et al.
Publicado: (2025)
Unmute the Patch Tokens: Rethinking Probing in Multi-Label Audio Classification
por: Rauch, Lukas, et al.
Publicado: (2025)
por: Rauch, Lukas, et al.
Publicado: (2025)
RUMAA: Repeat-Aware Unified Music Audio Analysis for Score-Performance Alignment, Transcription, and Mistake Detection
por: Chang, Sungkyun, et al.
Publicado: (2025)
por: Chang, Sungkyun, et al.
Publicado: (2025)
HeadRouter: Dynamic Head-Weight Routing for Task-Adaptive Audio Token Pruning in Large Audio Language Models
por: He, Peize, et al.
Publicado: (2026)
por: He, Peize, et al.
Publicado: (2026)
High-Fidelity Speech Enhancement via Discrete Audio Tokens
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
por: Lanzendörfer, Luca A., et al.
Publicado: (2025)
TASTE-Streaming: Towards Streamable Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2026)
Guiding Frame-Level CTC Alignments Using Self-knowledge Distillation
por: Kim, Eungbeom, et al.
Publicado: (2024)
por: Kim, Eungbeom, et al.
Publicado: (2024)
MAEB: Massive Audio Embedding Benchmark
por: Assadi, Adnan El, et al.
Publicado: (2026)
por: Assadi, Adnan El, et al.
Publicado: (2026)
Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities
por: Ghosh, Sreyan, et al.
Publicado: (2025)
por: Ghosh, Sreyan, et al.
Publicado: (2025)
Align With Purpose: Optimize Desired Properties in CTC Models with a General Plug-and-Play Framework
por: Segev, Eliya, et al.
Publicado: (2023)
por: Segev, Eliya, et al.
Publicado: (2023)
StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs
por: Song, Yuhan, et al.
Publicado: (2025)
por: Song, Yuhan, et al.
Publicado: (2025)
Synthetic Audio Helps for Cognitive State Tasks
por: Soubki, Adil, et al.
Publicado: (2025)
por: Soubki, Adil, et al.
Publicado: (2025)
Moonshine v2: Ergodic Streaming Encoder ASR for Latency-Critical Speech Applications
por: Kudlur, Manjunath, et al.
Publicado: (2026)
por: Kudlur, Manjunath, et al.
Publicado: (2026)
Beyond Fixed Frames: Dynamic Character-Aligned Speech Tokenization
por: Della Libera, Luca, et al.
Publicado: (2026)
por: Della Libera, Luca, et al.
Publicado: (2026)
Lossless Token Sequence Compression via Meta-Tokens
por: Harvill, John, et al.
Publicado: (2025)
por: Harvill, John, et al.
Publicado: (2025)
AIR-Bench: Benchmarking Large Audio-Language Models via Generative Comprehension
por: Yang, Qian, et al.
Publicado: (2024)
por: Yang, Qian, et al.
Publicado: (2024)
Learning When to Think While Listening in Large Audio-Language Models
por: Song, Zhiyuan, et al.
Publicado: (2026)
por: Song, Zhiyuan, et al.
Publicado: (2026)
EAT: Self-Supervised Pre-Training with Efficient Audio Transformer
por: Chen, Wenxi, et al.
Publicado: (2024)
por: Chen, Wenxi, et al.
Publicado: (2024)
CLAP-ART: Automated Audio Captioning with Semantic-rich Audio Representation Tokenizer
por: Takeuchi, Daiki, et al.
Publicado: (2025)
por: Takeuchi, Daiki, et al.
Publicado: (2025)
Competitive Audio-Language Models with Data-Efficient Single-Stage Training on Public Data
por: Kumar, Gokul Karthik, et al.
Publicado: (2025)
por: Kumar, Gokul Karthik, et al.
Publicado: (2025)
Aligning Spoken Dialogue Models from User Interactions
por: Wu, Anne, et al.
Publicado: (2025)
por: Wu, Anne, et al.
Publicado: (2025)
Improving Text-To-Audio Models with Synthetic Captions
por: Kong, Zhifeng, et al.
Publicado: (2024)
por: Kong, Zhifeng, et al.
Publicado: (2024)
TASTE: Text-Aligned Speech Tokenization and Embedding for Spoken Language Modeling
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
por: Tseng, Liang-Hsuan, et al.
Publicado: (2025)
ETTA: Elucidating the Design Space of Text-to-Audio Models
por: Lee, Sang-gil, et al.
Publicado: (2024)
por: Lee, Sang-gil, et al.
Publicado: (2024)
Ejemplares similares
-
CodecSep: Prompt-Driven Universal Sound Separation on Neural Audio Codec Latents
por: Banerjee, Adhiraj, et al.
Publicado: (2025) -
WavLink: Compact Audio-Text Embeddings with a Global Whisper Token
por: Kumar, Gokul Karthik, et al.
Publicado: (2026) -
Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization
por: Fang, Zheng, et al.
Publicado: (2026) -
AVCap: Leveraging Audio-Visual Features as Text Tokens for Captioning
por: Kim, Jongsuk, et al.
Publicado: (2024) -
TokenChain: A Discrete Speech Chain via Semantic Token Modeling
por: Wang, Mingxuan, et al.
Publicado: (2025)