Inference-Time Scaling for Visual AutoRegressive modeling by Searching Representative Samples
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Tang, Weidong, Wan, Xinyan, Li, Siyu, Wang, Xiumei |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Context-Enriched Contrastive Loss: Enhancing Presentation of Inherent Sample Connections in Contrastive Learning Framework
par: Deng, Haojin, et autres
Publié: (2025)
par: Deng, Haojin, et autres
Publié: (2025)
Implementing Adaptations for Vision AutoRegressive Model
par: Shaikh, Kaif, et autres
Publié: (2025)
par: Shaikh, Kaif, et autres
Publié: (2025)
Bridging SFT and DPO for Diffusion Model Alignment with Self-Sampling Preference Optimization
par: Zhang, Daoan, et autres
Publié: (2024)
par: Zhang, Daoan, et autres
Publié: (2024)
Once-For-All: A Train-Once and Select-Anytime Framework for Multimodal Instruction Tuning
par: Dong, Mingkang, et autres
Publié: (2026)
par: Dong, Mingkang, et autres
Publié: (2026)
Ultra-Low-Latency Spiking Neural Networks with Temporal-Dependent Integrate-and-Fire Neuron Model for Objects Detection
par: Zhang, Chengjun, et autres
Publié: (2025)
par: Zhang, Chengjun, et autres
Publié: (2025)
Tiny models from tiny data: Textual and null-text inversion for few-shot distillation
par: Landolsi, Erik, et autres
Publié: (2024)
par: Landolsi, Erik, et autres
Publié: (2024)
Enhancing Eye Feature Estimation from Event Data Streams through Adaptive Inference State Space Modeling
par: Nguyen, Viet Dung, et autres
Publié: (2026)
par: Nguyen, Viet Dung, et autres
Publié: (2026)
Adapting Multimodal Foundation Models for Few-Shot Learning: A Comprehensive Study on Contrastive Captioners
par: Narasinghe, N. K. B. M. P. K. B., et autres
Publié: (2025)
par: Narasinghe, N. K. B. M. P. K. B., et autres
Publié: (2025)
Sample as You Infer: Predictive Coding With Langevin Dynamics
par: Zahid, Umais, et autres
Publié: (2023)
par: Zahid, Umais, et autres
Publié: (2023)
AC-LoRA: Auto Component LoRA for Personalized Artistic Style Image Generation
par: Cui, Zhipu, et autres
Publié: (2025)
par: Cui, Zhipu, et autres
Publié: (2025)
Deep Domain Adaptation: A Sim2Real Neural Approach for Improving Eye-Tracking Systems
par: Nguyen, Viet Dung, et autres
Publié: (2024)
par: Nguyen, Viet Dung, et autres
Publié: (2024)
Explainable Classifier for Malignant Lymphoma Subtyping via Cell Graph and Image Fusion
par: Nishiyama, Daiki, et autres
Publié: (2025)
par: Nishiyama, Daiki, et autres
Publié: (2025)
Multi-Objective Optimization for Synthetic-to-Real Style Transfer
par: Chigot, Estelle, et autres
Publié: (2026)
par: Chigot, Estelle, et autres
Publié: (2026)
FlightSense: An End-to-End MLOps Platform for Real-Time Flight Delay Prediction via Rotation-Chain Propagation Features and Agentic Conversational AI
par: Shelke, Aditi J., et autres
Publié: (2026)
par: Shelke, Aditi J., et autres
Publié: (2026)
Super-additive Cooperation in Language Model Agents
par: Tonini, Filippo, et autres
Publié: (2025)
par: Tonini, Filippo, et autres
Publié: (2025)
Efficient Neural Network Encoding for 3D Color Lookup Tables
par: Zehtab, Vahid, et autres
Publié: (2024)
par: Zehtab, Vahid, et autres
Publié: (2024)
Better Schedules for Low Precision Training of Deep Neural Networks
par: Wolfe, Cameron R., et autres
Publié: (2024)
par: Wolfe, Cameron R., et autres
Publié: (2024)
Synthetic Photography Detection: A Visual Guidance for Identifying Synthetic Images Created by AI
par: Mathys, Melanie, et autres
Publié: (2024)
par: Mathys, Melanie, et autres
Publié: (2024)
E-CHUM: Event-based Cameras for Human Detection and Urban Monitoring
par: Brady, Jack, et autres
Publié: (2025)
par: Brady, Jack, et autres
Publié: (2025)
Aligning Language Models with Observational Data: Opportunities and Risks from a Causal Perspective
par: Loghmani, Erfan
Publié: (2025)
par: Loghmani, Erfan
Publié: (2025)
CerberusDet: Unified Multi-Dataset Object Detection
par: Tolstykh, Irina, et autres
Publié: (2024)
par: Tolstykh, Irina, et autres
Publié: (2024)
Sonar Image Datasets: A Comprehensive Survey of Resources, Challenges, and Applications
par: Gomes, Larissa S., et autres
Publié: (2025)
par: Gomes, Larissa S., et autres
Publié: (2025)
AgenticPruner: MAC-Constrained Neural Network Compression via LLM-Driven Strategy Search
par: Esmat, Shahrzad, et autres
Publié: (2026)
par: Esmat, Shahrzad, et autres
Publié: (2026)
CAMAL: Improving Attention Alignment and Faithfulness with Segmentation Masks
par: Hundal, Rajdeep Singh, et autres
Publié: (2026)
par: Hundal, Rajdeep Singh, et autres
Publié: (2026)
Event-based Solutions for Human-centered Applications: A Comprehensive Review
par: Adra, Mira, et autres
Publié: (2025)
par: Adra, Mira, et autres
Publié: (2025)
ReCo-Diff: Residual-Conditioned Deterministic Sampling for Cold Diffusion in Sparse-View CT
par: Choi, Yong Eun, et autres
Publié: (2026)
par: Choi, Yong Eun, et autres
Publié: (2026)
RepAir: A Framework for Airway Segmentation and Discontinuity Correction in CT
par: Oyer, John M., et autres
Publié: (2025)
par: Oyer, John M., et autres
Publié: (2025)
SupLID: Geometrical Guidance for Out-of-Distribution Detection in Semantic Segmentation
par: Udayangani, Nimeshika, et autres
Publié: (2025)
par: Udayangani, Nimeshika, et autres
Publié: (2025)
Consistency-Driven Calibration and Matching for Few-Shot Class-Incremental Learning
par: Wang, Qinzhe, et autres
Publié: (2025)
par: Wang, Qinzhe, et autres
Publié: (2025)
DV-Matcher: Deformation-based Non-Rigid Point Cloud Matching Guided by Pre-trained Visual Features
par: Chen, Zhangquan, et autres
Publié: (2024)
par: Chen, Zhangquan, et autres
Publié: (2024)
Domain Generalized Stereo Matching with Uncertainty-guided Data Augmentation
par: Du, Shuangli, et autres
Publié: (2025)
par: Du, Shuangli, et autres
Publié: (2025)
Self-supervised ControlNet with Spatio-Temporal Mamba for Real-world Video Super-resolution
par: Shi, Shijun, et autres
Publié: (2025)
par: Shi, Shijun, et autres
Publié: (2025)
Efficient Diffusion Training through Parallelization with Truncated Karhunen-Loève Expansion
par: Ren, Yumeng, et autres
Publié: (2025)
par: Ren, Yumeng, et autres
Publié: (2025)
Proto-FG3D: Prototype-based Interpretable Fine-Grained 3D Shape Classification
par: Ma, Shuxian, et autres
Publié: (2025)
par: Ma, Shuxian, et autres
Publié: (2025)
U-SEG: Uncertainty in SEGmentation -- A systematic multi-variable exploration
par: Smith, Michael, et autres
Publié: (2026)
par: Smith, Michael, et autres
Publié: (2026)
COLORA: Efficient Fine-Tuning for Convolutional Models with a Study Case on Optical Coherence Tomography Image Classification
par: Rivera, Mariano, et autres
Publié: (2025)
par: Rivera, Mariano, et autres
Publié: (2025)
Task-Aligned Self-Supervised Learning for Medical Image Analysis: A Systematic Review and Practical Design Guidelines
par: Wimalasiri, Chathura
Publié: (2026)
par: Wimalasiri, Chathura
Publié: (2026)
Automated Multi-Class Crop Pathology Classification via Convolutional Neural Networks: A Deep Learning Approach for Real-Time Precision Agriculture
par: Suri, Sourish, et autres
Publié: (2025)
par: Suri, Sourish, et autres
Publié: (2025)
Data-Augmented Multimodal Feature Fusion for Multiclass Visual Recognition of Oral Cancer Lesions
par: Naoum, Joy, et autres
Publié: (2025)
par: Naoum, Joy, et autres
Publié: (2025)
Doodle Your Keypoints: Sketch-Based Few-Shot Keypoint Detection
par: Maity, Subhajit, et autres
Publié: (2025)
par: Maity, Subhajit, et autres
Publié: (2025)
Documents similaires
-
Context-Enriched Contrastive Loss: Enhancing Presentation of Inherent Sample Connections in Contrastive Learning Framework
par: Deng, Haojin, et autres
Publié: (2025) -
Implementing Adaptations for Vision AutoRegressive Model
par: Shaikh, Kaif, et autres
Publié: (2025) -
Bridging SFT and DPO for Diffusion Model Alignment with Self-Sampling Preference Optimization
par: Zhang, Daoan, et autres
Publié: (2024) -
Once-For-All: A Train-Once and Select-Anytime Framework for Multimodal Instruction Tuning
par: Dong, Mingkang, et autres
Publié: (2026) -
Ultra-Low-Latency Spiking Neural Networks with Temporal-Dependent Integrate-and-Fire Neuron Model for Objects Detection
par: Zhang, Chengjun, et autres
Publié: (2025)