Guardado en:
| Autores principales: | Tian, Boyuan, Pang, Yihan, Huzaifa, Muhammad, Wang, Shenlong, Adve, Sarita |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2409.04018 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
EFSA: Episodic Few-Shot Adaptation for Text-to-Image Retrieval
por: Huzaifa, Muhammad, et al.
Publicado: (2024)
por: Huzaifa, Muhammad, et al.
Publicado: (2024)
CNN and ViT Efficiency Study on Tiny ImageNet and DermaMNIST Datasets
por: Amangeldi, Aidar, et al.
Publicado: (2025)
por: Amangeldi, Aidar, et al.
Publicado: (2025)
PhysGen3D: Crafting a Miniature Interactive World from a Single Image
por: Chen, Boyuan, et al.
Publicado: (2025)
por: Chen, Boyuan, et al.
Publicado: (2025)
Towards Latency-Aware 3D Streaming Perception for Autonomous Driving
por: Peng, Jiaqi, et al.
Publicado: (2025)
por: Peng, Jiaqi, et al.
Publicado: (2025)
Test-Time Low Rank Adaptation via Confidence Maximization for Zero-Shot Generalization of Vision-Language Models
por: Imam, Raza, et al.
Publicado: (2024)
por: Imam, Raza, et al.
Publicado: (2024)
AgMMU: A Comprehensive Agricultural Multimodal Understanding Benchmark
por: Gauba, Aruna, et al.
Publicado: (2025)
por: Gauba, Aruna, et al.
Publicado: (2025)
Vision-Language Navigation with Energy-Based Policy
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
Multi-Label Out-of-Distribution Detection with Spectral Normalized Joint Energy
por: Mei, Yihan, et al.
Publicado: (2024)
por: Mei, Yihan, et al.
Publicado: (2024)
NoPo-Avatar: Generalizable and Animatable Avatars from Sparse Inputs without Human Poses
por: Wen, Jing, et al.
Publicado: (2025)
por: Wen, Jing, et al.
Publicado: (2025)
LIFe-GoM: Generalizable Human Rendering with Learned Iterative Feedback Over Multi-Resolution Gaussians-on-Mesh
por: Wen, Jing, et al.
Publicado: (2025)
por: Wen, Jing, et al.
Publicado: (2025)
EnergyFormer: Energy Attention with Fourier Embedding for Hyperspectral Image Classification
por: Sohail, Saad, et al.
Publicado: (2025)
por: Sohail, Saad, et al.
Publicado: (2025)
Domain Adaptable Fine-Tune Distillation Framework For Advancing Farm Surveillance
por: Imam, Raza, et al.
Publicado: (2024)
por: Imam, Raza, et al.
Publicado: (2024)
Human-like Navigation in a World Built for Humans
por: Chandaka, Bhargav, et al.
Publicado: (2025)
por: Chandaka, Bhargav, et al.
Publicado: (2025)
Double-Exponential Increases in Inference Energy: The Cost of the Race for Accuracy
por: Yang, Zeyu, et al.
Publicado: (2024)
por: Yang, Zeyu, et al.
Publicado: (2024)
Energy-Latency Attacks via Sponge Poisoning
por: Cinà, Antonio Emanuele, et al.
Publicado: (2022)
por: Cinà, Antonio Emanuele, et al.
Publicado: (2022)
Towards Reproducible Learning-based Compression
por: Pang, Jiahao, et al.
Publicado: (2024)
por: Pang, Jiahao, et al.
Publicado: (2024)
Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
LidarDM: Generative LiDAR Simulation in a Generated World
por: Zyrianov, Vlas, et al.
Publicado: (2024)
por: Zyrianov, Vlas, et al.
Publicado: (2024)
Better, Stronger, Faster: Tackling the Trilemma in MLLM-based Segmentation with Simultaneous Textual Mask Prediction
por: Liu, Jiazhen, et al.
Publicado: (2025)
por: Liu, Jiazhen, et al.
Publicado: (2025)
TriAlignXA: An Explainable Trilemma Alignment Framework for Trustworthy Agri-product Grading
por: Xie, Jianfei, et al.
Publicado: (2025)
por: Xie, Jianfei, et al.
Publicado: (2025)
RepLDM: Reprogramming Pretrained Latent Diffusion Models for High-Quality, High-Efficiency, High-Resolution Image Generation
por: Cao, Boyuan, et al.
Publicado: (2024)
por: Cao, Boyuan, et al.
Publicado: (2024)
Energy-Latency Manipulation of Multi-modal Large Language Models via Verbose Samples
por: Gao, Kuofeng, et al.
Publicado: (2024)
por: Gao, Kuofeng, et al.
Publicado: (2024)
LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models
por: Yu, Haojie, et al.
Publicado: (2025)
por: Yu, Haojie, et al.
Publicado: (2025)
Micro-Structures Graph-Based Point Cloud Registration for Balancing Efficiency and Accuracy
por: Zhang, Rongling, et al.
Publicado: (2024)
por: Zhang, Rongling, et al.
Publicado: (2024)
Structure from Duplicates: Neural Inverse Graphics from a Pile of Objects
por: Cheng, Tianhang, et al.
Publicado: (2024)
por: Cheng, Tianhang, et al.
Publicado: (2024)
GoMAvatar: Efficient Animatable Human Modeling from Monocular Video Using Gaussians-on-Mesh
por: Wen, Jing, et al.
Publicado: (2024)
por: Wen, Jing, et al.
Publicado: (2024)
MonoPatchNeRF: Improving Neural Radiance Fields with Patch-based Monocular Guidance
por: Wu, Yuqun, et al.
Publicado: (2024)
por: Wu, Yuqun, et al.
Publicado: (2024)
Plenoptic PNG: Real-Time Neural Radiance Fields in 150 KB
por: Lee, Jae Yong, et al.
Publicado: (2024)
por: Lee, Jae Yong, et al.
Publicado: (2024)
Navigating the Accuracy-Size Trade-Off with Flexible Model Merging
por: Dhasade, Akash, et al.
Publicado: (2025)
por: Dhasade, Akash, et al.
Publicado: (2025)
WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark
por: Yuan, Peng, et al.
Publicado: (2026)
por: Yuan, Peng, et al.
Publicado: (2026)
ObjectCompose: Evaluating Resilience of Vision-Based Models on Object-to-Background Compositional Changes
por: Malik, Hashmat Shadab, et al.
Publicado: (2024)
por: Malik, Hashmat Shadab, et al.
Publicado: (2024)
Enhancing Boundary Segmentation for Topological Accuracy with Skeleton-based Methods
por: Liu, Chuni, et al.
Publicado: (2024)
por: Liu, Chuni, et al.
Publicado: (2024)
DISHA: Low-Energy Sparse Transformer at Edge for Outdoor Navigation for the Visually Impaired Individuals
por: Nagil, Praveen, et al.
Publicado: (2024)
por: Nagil, Praveen, et al.
Publicado: (2024)
Towards Low-Latency Event Stream-based Visual Object Tracking: A Slow-Fast Approach
por: Wang, Shiao, et al.
Publicado: (2025)
por: Wang, Shiao, et al.
Publicado: (2025)
Improving Facial Landmark Detection Accuracy and Efficiency with Knowledge Distillation
por: Hong, Zong-Wei, et al.
Publicado: (2024)
por: Hong, Zong-Wei, et al.
Publicado: (2024)
EdgePoint2: Compact Descriptors for Superior Efficiency and Accuracy
por: Yao, Haodi, et al.
Publicado: (2025)
por: Yao, Haodi, et al.
Publicado: (2025)
WorldDreamer: Towards General World Models for Video Generation via Predicting Masked Tokens
por: Wang, Xiaofeng, et al.
Publicado: (2024)
por: Wang, Xiaofeng, et al.
Publicado: (2024)
AutoVFX: Physically Realistic Video Editing from Natural Language Instructions
por: Hsu, Hao-Yu, et al.
Publicado: (2024)
por: Hsu, Hao-Yu, et al.
Publicado: (2024)
Generalizable Sparse-View 3D Reconstruction from Unconstrained Images
por: Gupta, Vinayak, et al.
Publicado: (2026)
por: Gupta, Vinayak, et al.
Publicado: (2026)
AD-GS: Object-Aware B-Spline Gaussian Splatting for Self-Supervised Autonomous Driving
por: Xu, Jiawei, et al.
Publicado: (2025)
por: Xu, Jiawei, et al.
Publicado: (2025)
Ejemplares similares
-
EFSA: Episodic Few-Shot Adaptation for Text-to-Image Retrieval
por: Huzaifa, Muhammad, et al.
Publicado: (2024) -
CNN and ViT Efficiency Study on Tiny ImageNet and DermaMNIST Datasets
por: Amangeldi, Aidar, et al.
Publicado: (2025) -
PhysGen3D: Crafting a Miniature Interactive World from a Single Image
por: Chen, Boyuan, et al.
Publicado: (2025) -
Towards Latency-Aware 3D Streaming Perception for Autonomous Driving
por: Peng, Jiaqi, et al.
Publicado: (2025) -
Test-Time Low Rank Adaptation via Confidence Maximization for Zero-Shot Generalization of Vision-Language Models
por: Imam, Raza, et al.
Publicado: (2024)