FileGram: Grounding Agent Personalization in File-System Behavioral Traces
Fuente:
arXiv
Saved in:
| Main Authors: | Liu, Shuai, Tian, Shulin, Hu, Kairui, Dong, Yuhao, Yang, Zhe, Li, Bo, Yang, Jingkang, Loy, Chen Change, Liu, Ziwei |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
HippoCamp: Benchmarking Contextual Agents on Personal Computers
by: Yang, Zhe, et al.
Published: (2026)
by: Yang, Zhe, et al.
Published: (2026)
FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation
by: Yang, Shuai, et al.
Published: (2024)
by: Yang, Shuai, et al.
Published: (2024)
A Simple Baseline for Streaming Video Understanding
by: Shen, Yujiao, et al.
Published: (2026)
by: Shen, Yujiao, et al.
Published: (2026)
Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
by: Yang, Shuai, et al.
Published: (2025)
by: Yang, Shuai, et al.
Published: (2025)
GroupDiff: Diffusion-based Group Portrait Editing
by: Jiang, Yuming, et al.
Published: (2024)
by: Jiang, Yuming, et al.
Published: (2024)
Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning
by: Tian, Shulin, et al.
Published: (2025)
by: Tian, Shulin, et al.
Published: (2025)
Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models
by: Dong, Yuhao, et al.
Published: (2024)
by: Dong, Yuhao, et al.
Published: (2024)
Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models
by: Dong, Yuhao, et al.
Published: (2026)
by: Dong, Yuhao, et al.
Published: (2026)
LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
by: Zhang, Kaichen, et al.
Published: (2024)
by: Zhang, Kaichen, et al.
Published: (2024)
Towards Language-Driven Video Inpainting via Multimodal Large Language Models
by: Wu, Jianzong, et al.
Published: (2024)
by: Wu, Jianzong, et al.
Published: (2024)
Learning 3D Garment Animation from Trajectories of A Piece of Cloth
by: Shao, Yidi, et al.
Published: (2025)
by: Shao, Yidi, et al.
Published: (2025)
High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning
by: Huang, Xinyu, et al.
Published: (2025)
by: Huang, Xinyu, et al.
Published: (2025)
Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition
by: Dong, Yuhao, et al.
Published: (2026)
by: Dong, Yuhao, et al.
Published: (2026)
MMInA: Benchmarking Multihop Multimodal Internet Agents
by: Tian, Shulin, et al.
Published: (2024)
by: Tian, Shulin, et al.
Published: (2024)
DifFace: Blind Face Restoration with Diffused Error Contraction
by: Yue, Zongsheng, et al.
Published: (2022)
by: Yue, Zongsheng, et al.
Published: (2022)
Generalized Out-of-Distribution Detection: A Survey
by: Yang, Jingkang, et al.
Published: (2021)
by: Yang, Jingkang, et al.
Published: (2021)
Octopus: Embodied Vision-Language Programmer from Environmental Feedback
by: Yang, Jingkang, et al.
Published: (2023)
by: Yang, Jingkang, et al.
Published: (2023)
EdgeSAM: Prompt-In-the-Loop Distillation for SAM
by: Zhou, Chong, et al.
Published: (2023)
by: Zhou, Chong, et al.
Published: (2023)
F-LMM: Grounding Frozen Large Multimodal Models
by: Wu, Size, et al.
Published: (2024)
by: Wu, Size, et al.
Published: (2024)
GausSim: Foreseeing Reality by Gaussian Simulator for Elastic Objects
by: Shao, Yidi, et al.
Published: (2024)
by: Shao, Yidi, et al.
Published: (2024)
Duolando: Follower GPT with Off-Policy Reinforcement Learning for Dance Accompaniment
by: Siyao, Li, et al.
Published: (2024)
by: Siyao, Li, et al.
Published: (2024)
Enhanced Generative Structure Prior for Chinese Text Image Super-resolution
by: Li, Xiaoming, et al.
Published: (2025)
by: Li, Xiaoming, et al.
Published: (2025)
Kalman-Inspired Feature Propagation for Video Face Super-Resolution
by: Feng, Ruicheng, et al.
Published: (2024)
by: Feng, Ruicheng, et al.
Published: (2024)
Generalizable Implicit Motion Modeling for Video Frame Interpolation
by: Guo, Zujin, et al.
Published: (2024)
by: Guo, Zujin, et al.
Published: (2024)
MVIP-NeRF: Multi-view 3D Inpainting on NeRF Scenes via Diffusion Prior
by: Chen, Honghua, et al.
Published: (2024)
by: Chen, Honghua, et al.
Published: (2024)
AITTI: Learning Adaptive Inclusive Token for Text-to-Image Generation
by: Hou, Xinyu, et al.
Published: (2024)
by: Hou, Xinyu, et al.
Published: (2024)
MEAT: Multiview Diffusion Model for Human Generation on Megapixels with Mesh Attention
by: Wang, Yuhan, et al.
Published: (2025)
by: Wang, Yuhan, et al.
Published: (2025)
Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models
by: Zhang, Fan, et al.
Published: (2024)
by: Zhang, Fan, et al.
Published: (2024)
MosaicFusion: Diffusion Models as Data Augmenters for Large Vocabulary Instance Segmentation
by: Xie, Jiahao, et al.
Published: (2023)
by: Xie, Jiahao, et al.
Published: (2023)
Efficient Diffusion Model for Image Restoration by Residual Shifting
by: Yue, Zongsheng, et al.
Published: (2024)
by: Yue, Zongsheng, et al.
Published: (2024)
Arbitrary-steps Image Super-resolution via Diffusion Inversion
by: Yue, Zongsheng, et al.
Published: (2024)
by: Yue, Zongsheng, et al.
Published: (2024)
MatAnyone: Stable Video Matting with Consistent Memory Propagation
by: Yang, Peiqing, et al.
Published: (2025)
by: Yang, Peiqing, et al.
Published: (2025)
GaussianAnything: Interactive Point Cloud Flow Matching For 3D Object Generation
by: Lan, Yushi, et al.
Published: (2024)
by: Lan, Yushi, et al.
Published: (2024)
WorldQA: Multimodal World Knowledge in Videos through Long-Chain Reasoning
by: Zhang, Yuanhan, et al.
Published: (2024)
by: Zhang, Yuanhan, et al.
Published: (2024)
A Personal Library Filing System
by: McIsaac, Donald N., et al.
Published: (1974)
by: McIsaac, Donald N., et al.
Published: (1974)
Uni-MMMU: A Massive Multi-discipline Multimodal Unified Benchmark
by: Zou, Kai, et al.
Published: (2025)
by: Zou, Kai, et al.
Published: (2025)
ObjCtrl-2.5D: Training-free Object Control with Camera Poses
by: Wang, Zhouxia, et al.
Published: (2024)
by: Wang, Zhouxia, et al.
Published: (2024)
Denoising as Adaptation: Noise-Space Domain Adaptation for Image Restoration
by: Liao, Kang, et al.
Published: (2024)
by: Liao, Kang, et al.
Published: (2024)
Omegance: A Single Parameter for Various Granularities in Diffusion-Based Synthesis
by: Hou, Xinyu, et al.
Published: (2024)
by: Hou, Xinyu, et al.
Published: (2024)
Trans-Adapter: A Plug-and-Play Framework for Transparent Image Inpainting
by: Dai, Yuekun, et al.
Published: (2025)
by: Dai, Yuekun, et al.
Published: (2025)
Similar Items
-
HippoCamp: Benchmarking Contextual Agents on Personal Computers
by: Yang, Zhe, et al.
Published: (2026) -
FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation
by: Yang, Shuai, et al.
Published: (2024) -
A Simple Baseline for Streaming Video Understanding
by: Shen, Yujiao, et al.
Published: (2026) -
Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence
by: Yang, Shuai, et al.
Published: (2025) -
GroupDiff: Diffusion-based Group Portrait Editing
by: Jiang, Yuming, et al.
Published: (2024)