Enregistré dans:
| Auteurs principaux: | Li, Tianqin, Zhao, Junru, Jiang, Dunhan, Wu, Shenghao, Ramirez, Alan, Lee, Tai Sing |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2506.01201 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Learning More by Seeing Less: Structure First Learning for Efficient, Transferable, and Human-Aligned Vision
par: Li, Tianqin, et autres
Publié: (2025)
par: Li, Tianqin, et autres
Publié: (2025)
Does resistance to style-transfer equal Global Shape Bias? Measuring network sensitivity to global shape configuration
par: Wen, Ziqi, et autres
Publié: (2023)
par: Wen, Ziqi, et autres
Publié: (2023)
From Local Cues to Global Percepts: Emergent Gestalt Organization in Self-Supervised Vision Models
par: Li, Tianqin, et autres
Publié: (2025)
par: Li, Tianqin, et autres
Publié: (2025)
In-Place Panoptic Radiance Field Segmentation with Perceptual Prior for 3D Scene Understanding
par: Li, Shenghao
Publié: (2024)
par: Li, Shenghao
Publié: (2024)
Modeling Rapid Contextual Learning in the Visual Cortex with Fast-Weight Deep Autoencoder Networks
par: Li, Yue, et autres
Publié: (2025)
par: Li, Yue, et autres
Publié: (2025)
Don't Judge Before You CLIP: A Unified Approach for Perceptual Tasks
par: Zalcher, Amit, et autres
Publié: (2025)
par: Zalcher, Amit, et autres
Publié: (2025)
Do We Always Need the Simplicity Bias? Looking for Optimal Inductive Biases in the Wild
par: Teney, Damien, et autres
Publié: (2025)
par: Teney, Damien, et autres
Publié: (2025)
Smart Feature is What You Need
par: Hu, Zhaoxin, et autres
Publié: (2024)
par: Hu, Zhaoxin, et autres
Publié: (2024)
Think Before You Segment: High-Quality Reasoning Segmentation with GPT Chain of Thoughts
par: Kao, Shiu-hong, et autres
Publié: (2025)
par: Kao, Shiu-hong, et autres
Publié: (2025)
Take Only What You Need: Rank Minimization as an Implicit Forgetting Regularizer in Continual Learning
par: Lu, Haodong, et autres
Publié: (2024)
par: Lu, Haodong, et autres
Publié: (2024)
SeTformer is What You Need for Vision and Language
par: Shamsolmoali, Pourya, et autres
Publié: (2024)
par: Shamsolmoali, Pourya, et autres
Publié: (2024)
Think Before You Act: A Two-Stage Framework for Mitigating Gender Bias Towards Vision-Language Tasks
par: Zhang, Yunqi, et autres
Publié: (2024)
par: Zhang, Yunqi, et autres
Publié: (2024)
Chameleon: Images Are What You Need For Multimodal Learning Robust To Missing Modalities
par: Liaqat, Muhammad Irzam, et autres
Publié: (2024)
par: Liaqat, Muhammad Irzam, et autres
Publié: (2024)
Think Bright, Diffuse Nice: Enhancing T2I-ICL via Inductive-Bias Hint Instruction and Query Contrastive Decoding
par: Ma, Zhiyong, et autres
Publié: (2026)
par: Ma, Zhiyong, et autres
Publié: (2026)
Learning to See What You Need: Gaze Attention for Multimodal Large Language Models
par: Song, Junha, et autres
Publié: (2026)
par: Song, Junha, et autres
Publié: (2026)
Masked Generative Transformer Is What You Need for Image Editing
par: Chow, Wei, et autres
Publié: (2026)
par: Chow, Wei, et autres
Publié: (2026)
Lite-SAM Is Actually What You Need for Segment Everything
par: Fu, Jianhai, et autres
Publié: (2024)
par: Fu, Jianhai, et autres
Publié: (2024)
Choose What You Need: Disentangled Representation Learning for Scene Text Recognition, Removal and Editing
par: Zhang, Boqiang, et autres
Publié: (2024)
par: Zhang, Boqiang, et autres
Publié: (2024)
Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning
par: Li, Yian, et autres
Publié: (2024)
par: Li, Yian, et autres
Publié: (2024)
Perceptual Classifiers: Detecting Generative Images using Perceptual Features
par: Durbha, Krishna Srikar, et autres
Publié: (2025)
par: Durbha, Krishna Srikar, et autres
Publié: (2025)
What You Have is What You Track: Adaptive and Robust Multimodal Tracking
par: Tan, Yuedong, et autres
Publié: (2025)
par: Tan, Yuedong, et autres
Publié: (2025)
Multi-View Representation is What You Need for Point-Cloud Pre-Training
par: Yan, Siming, et autres
Publié: (2023)
par: Yan, Siming, et autres
Publié: (2023)
See It Before You Grab It: Deep Learning-based Action Anticipation in Basketball
par: Roy, Arnau Barrera, et autres
Publié: (2025)
par: Roy, Arnau Barrera, et autres
Publié: (2025)
Low-Resolution Editing is All You Need for High-Resolution Editing
par: Lee, Junsung, et autres
Publié: (2025)
par: Lee, Junsung, et autres
Publié: (2025)
A Strong Inductive Bias: Gzip for binary image classification
par: Scilipoti, Marco, et autres
Publié: (2024)
par: Scilipoti, Marco, et autres
Publié: (2024)
Face-Voice Association with Inductive Bias for Maximum Class Separation
par: Moscati, Marta, et autres
Publié: (2026)
par: Moscati, Marta, et autres
Publié: (2026)
ParameterNet: Parameters Are All You Need
par: Han, Kai, et autres
Publié: (2023)
par: Han, Kai, et autres
Publié: (2023)
Forensic Self-Descriptions Are All You Need for Zero-Shot Detection, Open-Set Source Attribution, and Clustering of AI-generated Images
par: Nguyen, Tai D., et autres
Publié: (2025)
par: Nguyen, Tai D., et autres
Publié: (2025)
Leveraging Geometric Visual Illusions as Perceptual Inductive Biases for Vision Models
par: Yang, Haobo, et autres
Publié: (2025)
par: Yang, Haobo, et autres
Publié: (2025)
Beginning with You: Perceptual-Initialization Improves Vision-Language Representation and Alignment
par: Hu, Yang, et autres
Publié: (2025)
par: Hu, Yang, et autres
Publié: (2025)
Generating 360° Video is What You Need For a 3D Scene
par: Zhang, Zhaoyang, et autres
Publié: (2025)
par: Zhang, Zhaoyang, et autres
Publié: (2025)
Taxes Are All You Need: Integration of Taxonomical Hierarchy Relationships into the Contrastive Loss
par: Kokilepersaud, Kiran, et autres
Publié: (2024)
par: Kokilepersaud, Kiran, et autres
Publié: (2024)
Label Critic: Design Data Before Models
par: Bassi, Pedro R. A. S., et autres
Publié: (2024)
par: Bassi, Pedro R. A. S., et autres
Publié: (2024)
Emu3: Next-Token Prediction is All You Need
par: Wang, Xinlong, et autres
Publié: (2024)
par: Wang, Xinlong, et autres
Publié: (2024)
BiECVC: Gated Diversification of Bidirectional Contexts for Learned Video Compression
par: Jiang, Wei, et autres
Publié: (2025)
par: Jiang, Wei, et autres
Publié: (2025)
NijiGAN: Transform What You See into Anime with Contrastive Semi-Supervised Learning and Neural Ordinary Differential Equations
par: Santoso, Kevin Putra, et autres
Publié: (2024)
par: Santoso, Kevin Putra, et autres
Publié: (2024)
What Happens Before Decoding? Prefill Determines GUI Grounding in VLMs
par: Lin, Jiaping, et autres
Publié: (2026)
par: Lin, Jiaping, et autres
Publié: (2026)
LVC-LGMC: Joint Local and Global Motion Compensation for Learned Video Compression
par: Jiang, Wei, et autres
Publié: (2024)
par: Jiang, Wei, et autres
Publié: (2024)
AgenticOCR: Parsing Only What You Need for Efficient Retrieval-Augmented Generation
par: Wang, Zhengren, et autres
Publié: (2026)
par: Wang, Zhengren, et autres
Publié: (2026)
Diffusion Model with Cross Attention as an Inductive Bias for Disentanglement
par: Yang, Tao, et autres
Publié: (2024)
par: Yang, Tao, et autres
Publié: (2024)
Documents similaires
-
Learning More by Seeing Less: Structure First Learning for Efficient, Transferable, and Human-Aligned Vision
par: Li, Tianqin, et autres
Publié: (2025) -
Does resistance to style-transfer equal Global Shape Bias? Measuring network sensitivity to global shape configuration
par: Wen, Ziqi, et autres
Publié: (2023) -
From Local Cues to Global Percepts: Emergent Gestalt Organization in Self-Supervised Vision Models
par: Li, Tianqin, et autres
Publié: (2025) -
In-Place Panoptic Radiance Field Segmentation with Perceptual Prior for 3D Scene Understanding
par: Li, Shenghao
Publié: (2024) -
Modeling Rapid Contextual Learning in the Visual Cortex with Fast-Weight Deep Autoencoder Networks
par: Li, Yue, et autres
Publié: (2025)