Understanding the Effect of using Semantically Meaningful Tokens for Visual Representation Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | Kalibhat, Neha, Kattakinda, Priyatham, Nawathe, Sumit, Zarei, Arman, Seleznev, Nikita, Sharpe, Samuel, Kumar, Senthil, Feizi, Soheil |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Maestro: Joint Graph & Config Optimization for Reliable AI Agents
di: Wang, Wenxiao, et al.
Pubblicazione: (2025)
di: Wang, Wenxiao, et al.
Pubblicazione: (2025)
Improving Compositional Attribute Binding in Text-to-Image Generative Models via Enhanced Text Embeddings
di: Zarei, Arman, et al.
Pubblicazione: (2024)
di: Zarei, Arman, et al.
Pubblicazione: (2024)
Fast Adversarial Attacks on Language Models In One GPU Minute
di: Sadasivan, Vinu Sankar, et al.
Pubblicazione: (2024)
di: Sadasivan, Vinu Sankar, et al.
Pubblicazione: (2024)
Early Stopping for Large Reasoning Models via Confidence Dynamics
di: Hosseini, Parsa, et al.
Pubblicazione: (2026)
di: Hosseini, Parsa, et al.
Pubblicazione: (2026)
SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs
di: Hosseini, Parsa, et al.
Pubblicazione: (2025)
di: Hosseini, Parsa, et al.
Pubblicazione: (2025)
Rethinking Artistic Copyright Infringements in the Era of Text-to-Image Generative Models
di: Moayeri, Mazda, et al.
Pubblicazione: (2024)
di: Moayeri, Mazda, et al.
Pubblicazione: (2024)
On Mechanistic Knowledge Localization in Text-to-Image Generative Models
di: Basu, Samyadeep, et al.
Pubblicazione: (2024)
di: Basu, Samyadeep, et al.
Pubblicazione: (2024)
AgentComp: From Agentic Reasoning to Compositional Mastery in Text-to-Image Models
di: Zarei, Arman, et al.
Pubblicazione: (2025)
di: Zarei, Arman, et al.
Pubblicazione: (2025)
DREW : Towards Robust Data Provenance by Leveraging Error-Controlled Watermarking
di: Saberi, Mehrdad, et al.
Pubblicazione: (2024)
di: Saberi, Mehrdad, et al.
Pubblicazione: (2024)
Dynamic Tokenization via Reinforcement Patching: End-to-end Training and Zero-shot Transfer
di: Wu, Yulun, et al.
Pubblicazione: (2026)
di: Wu, Yulun, et al.
Pubblicazione: (2026)
SliderEdit: Continuous Image Editing with Fine-Grained Instruction Control
di: Zarei, Arman, et al.
Pubblicazione: (2025)
di: Zarei, Arman, et al.
Pubblicazione: (2025)
Localizing Knowledge in Diffusion Transformers
di: Zarei, Arman, et al.
Pubblicazione: (2025)
di: Zarei, Arman, et al.
Pubblicazione: (2025)
Multimodal Deep Reinforcement Learning for Portfolio Optimization
di: Nawathe, Sumit, et al.
Pubblicazione: (2024)
di: Nawathe, Sumit, et al.
Pubblicazione: (2024)
Decomposing and Interpreting Image Representations via Text in ViTs Beyond CLIP
di: Balasubramanian, Sriram, et al.
Pubblicazione: (2024)
di: Balasubramanian, Sriram, et al.
Pubblicazione: (2024)
Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry
di: Saha, Shoumik, et al.
Pubblicazione: (2026)
di: Saha, Shoumik, et al.
Pubblicazione: (2026)
Reasoning Under Uncertainty: Exploring Probabilistic Reasoning Capabilities of LLMs
di: Pournemat, Mobina, et al.
Pubblicazione: (2025)
di: Pournemat, Mobina, et al.
Pubblicazione: (2025)
Off-the-Shelf LLMs as Process Scorers: Training-Free Alternative to PRMs for Mathematical Reasoning
di: Chegini, Atoosa, et al.
Pubblicazione: (2026)
di: Chegini, Atoosa, et al.
Pubblicazione: (2026)
Almost AI, Almost Human: The Challenge of Detecting AI-Polished Writing
di: Saha, Shoumik, et al.
Pubblicazione: (2025)
di: Saha, Shoumik, et al.
Pubblicazione: (2025)
How Learnable Grids Recover Fine Detail in Low Dimensions: A Neural Tangent Kernel Analysis of Multigrid Parametric Encodings
di: Audia, Samuel, et al.
Pubblicazione: (2025)
di: Audia, Samuel, et al.
Pubblicazione: (2025)
Do Diffusion Models Learn Semantically Meaningful and Efficient Representations?
di: Liang, Qiyao, et al.
Pubblicazione: (2024)
di: Liang, Qiyao, et al.
Pubblicazione: (2024)
TimeSqueeze: Dynamic Patching for Efficient Time Series Forecasting
di: Ankireddy, Sravan Kumar, et al.
Pubblicazione: (2026)
di: Ankireddy, Sravan Kumar, et al.
Pubblicazione: (2026)
A Closer Look at Bias and Chain-of-Thought Faithfulness of Large (Vision) Language Models
di: Balasubramanian, Sriram, et al.
Pubblicazione: (2025)
di: Balasubramanian, Sriram, et al.
Pubblicazione: (2025)
Chain-of-Defensive-Thought: Structured Reasoning Elicits Robustness in Large Language Models against Reference Corruption
di: Wang, Wenxiao, et al.
Pubblicazione: (2025)
di: Wang, Wenxiao, et al.
Pubblicazione: (2025)
SpecHop: Continuous Speculation for Accelerating Multi-Hop Retrieval Agents
di: Saberi, Mehrdad, et al.
Pubblicazione: (2026)
di: Saberi, Mehrdad, et al.
Pubblicazione: (2026)
Effect of Sensory Adapted Dental Environment (SADE) on physiological and behavioral parameters related to stress and anxiety in children with Autism Spectrum Disorder (ASD) undergoing dental treatment: A systematic review and meta‐analysis
di: Sunny Priyatham Tirupathi, et al.
Pubblicazione: (2024)
di: Sunny Priyatham Tirupathi, et al.
Pubblicazione: (2024)
IConMark: Robust Interpretable Concept-Based Watermark For AI Images
di: Sadasivan, Vinu Sankar, et al.
Pubblicazione: (2025)
di: Sadasivan, Vinu Sankar, et al.
Pubblicazione: (2025)
Understanding Information Storage and Transfer in Multi-modal Large Language Models
di: Basu, Samyadeep, et al.
Pubblicazione: (2024)
di: Basu, Samyadeep, et al.
Pubblicazione: (2024)
Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits
di: Kalibhat, Neha, et al.
Pubblicazione: (2026)
di: Kalibhat, Neha, et al.
Pubblicazione: (2026)
DyePack: Provably Flagging Test Set Contamination in LLMs Using Backdoors
di: Cheng, Yize, et al.
Pubblicazione: (2025)
di: Cheng, Yize, et al.
Pubblicazione: (2025)
Revisiting the Past: Data Unlearning with Model State History
di: Rezaei, Keivan, et al.
Pubblicazione: (2025)
di: Rezaei, Keivan, et al.
Pubblicazione: (2025)
Endor: Hardware-Friendly Sparse Format for Offloaded LLM Inference
di: Joo, Donghyeon, et al.
Pubblicazione: (2024)
di: Joo, Donghyeon, et al.
Pubblicazione: (2024)
PRIME: Prioritizing Interpretability in Failure Mode Extraction
di: Rezaei, Keivan, et al.
Pubblicazione: (2023)
di: Rezaei, Keivan, et al.
Pubblicazione: (2023)
Can AI-Generated Text be Reliably Detected?
di: Sadasivan, Vinu Sankar, et al.
Pubblicazione: (2023)
di: Sadasivan, Vinu Sankar, et al.
Pubblicazione: (2023)
Discovering Meaningful Units with Visually Grounded Semantics from Image Captions
di: Behjati, Melika, et al.
Pubblicazione: (2025)
di: Behjati, Melika, et al.
Pubblicazione: (2025)
Are Vision Transformer Representations Semantically Meaningful? A Case Study in Medical Imaging
di: Shams, Montasir, et al.
Pubblicazione: (2025)
di: Shams, Montasir, et al.
Pubblicazione: (2025)
On the Role of Discrete Tokenization in Visual Representation Learning
di: Du, Tianqi, et al.
Pubblicazione: (2024)
di: Du, Tianqi, et al.
Pubblicazione: (2024)
IntCoOp: Interpretability-Aware Vision-Language Prompt Tuning
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
di: Ghosal, Soumya Suvra, et al.
Pubblicazione: (2024)
Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World
di: Sadasivan, Vinu Sankar, et al.
Pubblicazione: (2025)
di: Sadasivan, Vinu Sankar, et al.
Pubblicazione: (2025)
Online Advertisements with LLMs: Opportunities and Challenges
di: Feizi, Soheil, et al.
Pubblicazione: (2023)
di: Feizi, Soheil, et al.
Pubblicazione: (2023)
RePanda: Pandas-powered Tabular Verification and Reasoning
di: Chegini, Atoosa Malemir, et al.
Pubblicazione: (2025)
di: Chegini, Atoosa Malemir, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Maestro: Joint Graph & Config Optimization for Reliable AI Agents
di: Wang, Wenxiao, et al.
Pubblicazione: (2025) -
Improving Compositional Attribute Binding in Text-to-Image Generative Models via Enhanced Text Embeddings
di: Zarei, Arman, et al.
Pubblicazione: (2024) -
Fast Adversarial Attacks on Language Models In One GPU Minute
di: Sadasivan, Vinu Sankar, et al.
Pubblicazione: (2024) -
Early Stopping for Large Reasoning Models via Confidence Dynamics
di: Hosseini, Parsa, et al.
Pubblicazione: (2026) -
SpurLens: Automatic Detection of Spurious Cues in Multimodal LLMs
di: Hosseini, Parsa, et al.
Pubblicazione: (2025)