Images are Worth Variable Length of Representations
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Mao, Lingjun, Corona, Rodolfo, Liang, Xin, Yan, Wenhao, Tang, Zineng |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Evaluating Model Perception of Color Illusions in Photorealistic Scenes
par: Mao, Lingjun, et autres
Publié: (2024)
par: Mao, Lingjun, et autres
Publié: (2024)
Grounding Language in Multi-Perspective Referential Communication
par: Tang, Zineng, et autres
Publié: (2024)
par: Tang, Zineng, et autres
Publié: (2024)
Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation
par: Tang, Raphael, et autres
Publié: (2024)
par: Tang, Raphael, et autres
Publié: (2024)
An Image is Worth 32 Tokens for Reconstruction and Generation
par: Yu, Qihang, et autres
Publié: (2024)
par: Yu, Qihang, et autres
Publié: (2024)
Tell Codec What Worth Compressing: Semantically Disentangled Image Coding for Machine with LMMs
par: Liu, Jinming, et autres
Publié: (2024)
par: Liu, Jinming, et autres
Publié: (2024)
VAT: Vision Action Transformer by Unlocking Full Representation of ViT
par: Li, Wenhao, et autres
Publié: (2025)
par: Li, Wenhao, et autres
Publié: (2025)
iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models
par: Hu, Lianyu, et autres
Publié: (2024)
par: Hu, Lianyu, et autres
Publié: (2024)
Vript: A Video Is Worth Thousands of Words
par: Yang, Dongjie, et autres
Publié: (2024)
par: Yang, Dongjie, et autres
Publié: (2024)
Scaling Laws in Patchification: An Image Is Worth 50,176 Tokens And More
par: Wang, Feng, et autres
Publié: (2025)
par: Wang, Feng, et autres
Publié: (2025)
An Item is Worth a Prompt: Versatile Image Editing with Disentangled Control
par: Feng, Aosong, et autres
Publié: (2024)
par: Feng, Aosong, et autres
Publié: (2024)
A Creative Agent is Worth a 64-Token Template
par: Shi, Ruixiao, et autres
Publié: (2026)
par: Shi, Ruixiao, et autres
Publié: (2026)
An Image Is Worth Ten Thousand Words: Verbose-Text Induction Attacks on VLMs
par: Luo, Zhi, et autres
Publié: (2025)
par: Luo, Zhi, et autres
Publié: (2025)
Self-supervised Photographic Image Layout Representation Learning
par: Zhao, Zhaoran, et autres
Publié: (2024)
par: Zhao, Zhaoran, et autres
Publié: (2024)
An Image Is Worth 1000 Lies: Adversarial Transferability across Prompts on Vision-Language Models
par: Luo, Haochen, et autres
Publié: (2024)
par: Luo, Haochen, et autres
Publié: (2024)
Two-Stage Decoupling Framework for Variable-Length Glaucoma Prognosis
par: Song, Yiran, et autres
Publié: (2025)
par: Song, Yiran, et autres
Publié: (2025)
Multimodal Representation Alignment for Image Generation: Text-Image Interleaved Control Is Easier Than You Think
par: Chen, Liang, et autres
Publié: (2025)
par: Chen, Liang, et autres
Publié: (2025)
A Video Is Not Worth a Thousand Words
par: Pollard, Sam, et autres
Publié: (2025)
par: Pollard, Sam, et autres
Publié: (2025)
Information-Maximized Soft Variable Discretization for Self-Supervised Image Representation Learning
par: Niu, Chuang, et autres
Publié: (2025)
par: Niu, Chuang, et autres
Publié: (2025)
A Label is Worth a Thousand Images in Dataset Distillation
par: Qin, Tian, et autres
Publié: (2024)
par: Qin, Tian, et autres
Publié: (2024)
Towards Imperceptible JPEG Image Hiding: Multi-range Representations-driven Adversarial Stego Generation
par: Yang, Junxue, et autres
Publié: (2025)
par: Yang, Junxue, et autres
Publié: (2025)
A Task is Worth One Word: Learning with Task Prompts for High-Quality Versatile Image Inpainting
par: Zhuang, Junhao, et autres
Publié: (2023)
par: Zhuang, Junhao, et autres
Publié: (2023)
ARTS: Semi-Analytical Regressor using Disentangled Skeletal Representations for Human Mesh Recovery from Videos
par: Tang, Tao, et autres
Publié: (2024)
par: Tang, Tao, et autres
Publié: (2024)
A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens
par: Kerssies, Tommie, et autres
Publié: (2026)
par: Kerssies, Tommie, et autres
Publié: (2026)
Fixed-Length Dense Fingerprint Representation with Alignment and Robust Enhancement
par: Pan, Zhiyu, et autres
Publié: (2025)
par: Pan, Zhiyu, et autres
Publié: (2025)
Good Enough: Is it Worth Improving your Label Quality?
par: Jaus, Alexander, et autres
Publié: (2025)
par: Jaus, Alexander, et autres
Publié: (2025)
A LoRA is Worth a Thousand Pictures
par: Liu, Chenxi, et autres
Publié: (2024)
par: Liu, Chenxi, et autres
Publié: (2024)
What is Point Supervision Worth in Video Instance Segmentation?
par: Huang, Shuaiyi, et autres
Publié: (2024)
par: Huang, Shuaiyi, et autres
Publié: (2024)
Contrastive Learning for Image Complexity Representation
par: Liu, Shipeng, et autres
Publié: (2024)
par: Liu, Shipeng, et autres
Publié: (2024)
TIP-I2V: A Million-Scale Real Text and Image Prompt Dataset for Image-to-Video Generation
par: Wang, Wenhao, et autres
Publié: (2024)
par: Wang, Wenhao, et autres
Publié: (2024)
A Scene is Worth a Thousand Features: Feed-Forward Camera Localization from a Collection of Image Features
par: Barroso-Laguna, Axel, et autres
Publié: (2025)
par: Barroso-Laguna, Axel, et autres
Publié: (2025)
Any 3D Scene is Worth 1K Tokens: 3D-Grounded Representation for Scene Generation at Scale
par: Wei, Dongxu, et autres
Publié: (2026)
par: Wei, Dongxu, et autres
Publié: (2026)
Prior-Guided Residual Diffusion: Calibrated and Efficient Medical Image Segmentation
par: Mao, Fuyou, et autres
Publié: (2025)
par: Mao, Fuyou, et autres
Publié: (2025)
LEDiT: Your Length-Extrapolatable Diffusion Transformer without Positional Encoding
par: Zhang, Shen, et autres
Publié: (2025)
par: Zhang, Shen, et autres
Publié: (2025)
Calibration Attention: Learning Reliability-Aware Representations for Vision Transformers
par: Liang, Wenhao, et autres
Publié: (2025)
par: Liang, Wenhao, et autres
Publié: (2025)
Not Every Image is Worth a Thousand Words: Quantifying Originality in Stable Diffusion
par: Haviv, Adi, et autres
Publié: (2024)
par: Haviv, Adi, et autres
Publié: (2024)
Boosting of Implicit Neural Representation-based Image Denoiser
par: Yan, Zipei, et autres
Publié: (2024)
par: Yan, Zipei, et autres
Publié: (2024)
CLID: Controlled-Length Image Descriptions with Limited Data
par: Hirsch, Elad, et autres
Publié: (2022)
par: Hirsch, Elad, et autres
Publié: (2022)
An Object is Worth 64x64 Pixels: Generating 3D Object via Image Diffusion
par: Yan, Xingguang, et autres
Publié: (2024)
par: Yan, Xingguang, et autres
Publié: (2024)
CLIC: Contrastive Learning Framework for Unsupervised Image Complexity Representation
par: Liu, Shipeng, et autres
Publié: (2024)
par: Liu, Shipeng, et autres
Publié: (2024)
BoQ: A Place is Worth a Bag of Learnable Queries
par: Ali-Bey, Amar, et autres
Publié: (2024)
par: Ali-Bey, Amar, et autres
Publié: (2024)
Documents similaires
-
Evaluating Model Perception of Color Illusions in Photorealistic Scenes
par: Mao, Lingjun, et autres
Publié: (2024) -
Grounding Language in Multi-Perspective Referential Communication
par: Tang, Zineng, et autres
Publié: (2024) -
Words Worth a Thousand Pictures: Measuring and Understanding Perceptual Variability in Text-to-Image Generation
par: Tang, Raphael, et autres
Publié: (2024) -
An Image is Worth 32 Tokens for Reconstruction and Generation
par: Yu, Qihang, et autres
Publié: (2024) -
Tell Codec What Worth Compressing: Semantically Disentangled Image Coding for Machine with LMMs
par: Liu, Jinming, et autres
Publié: (2024)