HippoCamp: Benchmarking Contextual Agents on Personal Computers
Fuente:
arXiv
Salvato in:
| Autori principali: | Yang, Zhe, Tian, Shulin, Hu, Kairui, Liu, Shuai, Nguyen, Hoang-Nhat, Zhang, Yichi, Guo, Zujin, Yu, Mengying, Zhang, Zinan, Yang, Jingkang, Loy, Chen Change, Liu, Ziwei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FileGram: Grounding Agent Personalization in File-System Behavioral Traces
di: Liu, Shuai, et al.
Pubblicazione: (2026)
di: Liu, Shuai, et al.
Pubblicazione: (2026)
FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation
di: Yang, Shuai, et al.
Pubblicazione: (2024)
di: Yang, Shuai, et al.
Pubblicazione: (2024)
Generalizable Implicit Motion Modeling for Video Frame Interpolation
di: Guo, Zujin, et al.
Pubblicazione: (2024)
di: Guo, Zujin, et al.
Pubblicazione: (2024)
A Simple Baseline for Streaming Video Understanding
di: Shen, Yujiao, et al.
Pubblicazione: (2026)
di: Shen, Yujiao, et al.
Pubblicazione: (2026)
Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
di: Yang, Shuai, et al.
Pubblicazione: (2025)
di: Yang, Shuai, et al.
Pubblicazione: (2025)
Pair then Relation: Pair-Net for Panoptic Scene Graph Generation
di: Wang, Jinghao, et al.
Pubblicazione: (2023)
di: Wang, Jinghao, et al.
Pubblicazione: (2023)
Controllable Human-centric Keyframe Interpolation with Generative Prior
di: Guo, Zujin, et al.
Pubblicazione: (2025)
di: Guo, Zujin, et al.
Pubblicazione: (2025)
GroupDiff: Diffusion-based Group Portrait Editing
di: Jiang, Yuming, et al.
Pubblicazione: (2024)
di: Jiang, Yuming, et al.
Pubblicazione: (2024)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
MMInA: Benchmarking Multihop Multimodal Internet Agents
di: Tian, Shulin, et al.
Pubblicazione: (2024)
di: Tian, Shulin, et al.
Pubblicazione: (2024)
Contextual Object Detection with Multimodal Large Language Models
di: Zang, Yuhang, et al.
Pubblicazione: (2023)
di: Zang, Yuhang, et al.
Pubblicazione: (2023)
DifFace: Blind Face Restoration with Diffused Error Contraction
di: Yue, Zongsheng, et al.
Pubblicazione: (2022)
di: Yue, Zongsheng, et al.
Pubblicazione: (2022)
Generalized Out-of-Distribution Detection: A Survey
di: Yang, Jingkang, et al.
Pubblicazione: (2021)
di: Yang, Jingkang, et al.
Pubblicazione: (2021)
Duolando: Follower GPT with Off-Policy Reinforcement Learning for Dance Accompaniment
di: Siyao, Li, et al.
Pubblicazione: (2024)
di: Siyao, Li, et al.
Pubblicazione: (2024)
Generate Your Talking Avatar from Video Reference
di: Guo, Zujin, et al.
Pubblicazione: (2026)
di: Guo, Zujin, et al.
Pubblicazione: (2026)
AHAN: Asymmetric Hierarchical Attention Network for Identical Twin Face Verification
di: Nguyen, Hoang-Nhat
Pubblicazione: (2026)
di: Nguyen, Hoang-Nhat
Pubblicazione: (2026)
MosaicFusion: Diffusion Models as Data Augmenters for Large Vocabulary Instance Segmentation
di: Xie, Jiahao, et al.
Pubblicazione: (2023)
di: Xie, Jiahao, et al.
Pubblicazione: (2023)
MEAT: Multiview Diffusion Model for Human Generation on Megapixels with Mesh Attention
di: Wang, Yuhan, et al.
Pubblicazione: (2025)
di: Wang, Yuhan, et al.
Pubblicazione: (2025)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
di: Tian, Shulin, et al.
Pubblicazione: (2025)
di: Tian, Shulin, et al.
Pubblicazione: (2025)
Enhanced Generative Structure Prior for Chinese Text Image Super-resolution
di: Li, Xiaoming, et al.
Pubblicazione: (2025)
di: Li, Xiaoming, et al.
Pubblicazione: (2025)
Learning 3D Garment Animation from Trajectories of A Piece of Cloth
di: Shao, Yidi, et al.
Pubblicazione: (2025)
di: Shao, Yidi, et al.
Pubblicazione: (2025)
Kalman-Inspired Feature Propagation for Video Face Super-Resolution
di: Feng, Ruicheng, et al.
Pubblicazione: (2024)
di: Feng, Ruicheng, et al.
Pubblicazione: (2024)
MVIP-NeRF: Multi-view 3D Inpainting on NeRF Scenes via Diffusion Prior
di: Chen, Honghua, et al.
Pubblicazione: (2024)
di: Chen, Honghua, et al.
Pubblicazione: (2024)
Efficient Diffusion Model for Image Restoration by Residual Shifting
di: Yue, Zongsheng, et al.
Pubblicazione: (2024)
di: Yue, Zongsheng, et al.
Pubblicazione: (2024)
AITTI: Learning Adaptive Inclusive Token for Text-to-Image Generation
di: Hou, Xinyu, et al.
Pubblicazione: (2024)
di: Hou, Xinyu, et al.
Pubblicazione: (2024)
Arbitrary-steps Image Super-resolution via Diffusion Inversion
di: Yue, Zongsheng, et al.
Pubblicazione: (2024)
di: Yue, Zongsheng, et al.
Pubblicazione: (2024)
Ancona inequalities along generic geodesic rays
di: Liu, Kairui, et al.
Pubblicazione: (2025)
di: Liu, Kairui, et al.
Pubblicazione: (2025)
UNO: Unifying One-stage Video Scene Graph Generation via Object-Centric Visual Representation Learning
di: Le, Huy, et al.
Pubblicazione: (2025)
di: Le, Huy, et al.
Pubblicazione: (2025)
Playing for 3D Human Recovery
di: Cai, Zhongang, et al.
Pubblicazione: (2021)
di: Cai, Zhongang, et al.
Pubblicazione: (2021)
MatAnyone: Stable Video Matting with Consistent Memory Propagation
di: Yang, Peiqing, et al.
Pubblicazione: (2025)
di: Yang, Peiqing, et al.
Pubblicazione: (2025)
TSCAN: Context-Aware Uplift Modeling via Two-Stage Training for Online Merchant Business Diagnosis
di: Zhang, Hangtao, et al.
Pubblicazione: (2025)
di: Zhang, Hangtao, et al.
Pubblicazione: (2025)
WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
di: Zhang, Yuanhan, et al.
Pubblicazione: (2024)
Transformer-Based Visual Segmentation: A Survey
di: Li, Xiangtai, et al.
Pubblicazione: (2023)
di: Li, Xiangtai, et al.
Pubblicazione: (2023)
4D Panoptic Scene Graph Generation
di: Yang, Jingkang, et al.
Pubblicazione: (2024)
di: Yang, Jingkang, et al.
Pubblicazione: (2024)
FunQA: Towards Surprising Video Comprehension
di: Xie, Binzhu, et al.
Pubblicazione: (2023)
di: Xie, Binzhu, et al.
Pubblicazione: (2023)
ObjCtrl-2.5D: Training-free Object Control with Camera Poses
di: Wang, Zhouxia, et al.
Pubblicazione: (2024)
di: Wang, Zhouxia, et al.
Pubblicazione: (2024)
Denoising as Adaptation: Noise-Space Domain Adaptation for Image Restoration
di: Liao, Kang, et al.
Pubblicazione: (2024)
di: Liao, Kang, et al.
Pubblicazione: (2024)
Omegance: A Single Parameter for Various Granularities in Diffusion-Based Synthesis
di: Hou, Xinyu, et al.
Pubblicazione: (2024)
di: Hou, Xinyu, et al.
Pubblicazione: (2024)
Trans-Adapter: A Plug-and-Play Framework for Transparent Image Inpainting
di: Dai, Yuekun, et al.
Pubblicazione: (2025)
di: Dai, Yuekun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
FileGram: Grounding Agent Personalization in File-System Behavioral Traces
di: Liu, Shuai, et al.
Pubblicazione: (2026) -
FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation
di: Yang, Shuai, et al.
Pubblicazione: (2024) -
Generalizable Implicit Motion Modeling for Video Frame Interpolation
di: Guo, Zujin, et al.
Pubblicazione: (2024) -
A Simple Baseline for Streaming Video Understanding
di: Shen, Yujiao, et al.
Pubblicazione: (2026) -
Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
di: Yang, Shuai, et al.
Pubblicazione: (2025)