SoAy: A Solution-based LLM API-using Methodology for Academic Information Seeking
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yuanchun, Yu, Jifan, Yao, Zijun, Zhang, Jing, Xie, Yuyang, Tu, Shangqing, Fu, Yiyang, Feng, Youhe, Zhang, Jinkai, Zhang, Jingyao, Huang, Bowen, Li, Yuanyao, Yuan, Huihui, Hou, Lei, Li, Juanzi, Tang, Jie |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time
por: Tu, Shangqing, et al.
Publicado: (2023)
por: Tu, Shangqing, et al.
Publicado: (2023)
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2023)
por: Tu, Shangqing, et al.
Publicado: (2023)
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
MAIC-UI: Making Interactive Courseware with Generative UI
por: Tu, Shangqing, et al.
Publicado: (2026)
por: Tu, Shangqing, et al.
Publicado: (2026)
LecEval: An Automated Metric for Multimodal Knowledge Acquisition in Multimedia Learning
por: Yin, Joy Lim Jia, et al.
Publicado: (2025)
por: Yin, Joy Lim Jia, et al.
Publicado: (2025)
Knowledge-to-Jailbreak: Investigating Knowledge-driven Jailbreaking Attacks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024)
por: Tu, Shangqing, et al.
Publicado: (2024)
DeepPrune: Parallel Scaling without Inter-trace Redundancy
por: Tu, Shangqing, et al.
Publicado: (2025)
por: Tu, Shangqing, et al.
Publicado: (2025)
Evaluating Generative Language Models in Information Extraction as Subjective Question Correction
por: Fan, Yuchen, et al.
Publicado: (2024)
por: Fan, Yuchen, et al.
Publicado: (2024)
A Cause-Effect Look at Alleviating Hallucination of Knowledge-grounded Dialogue Generation
por: Yu, Jifan, et al.
Publicado: (2024)
por: Yu, Jifan, et al.
Publicado: (2024)
Reverse That Number! Decoding Order Matters in Arithmetic Learning
por: Zhang-Li, Daniel, et al.
Publicado: (2024)
por: Zhang-Li, Daniel, et al.
Publicado: (2024)
Transferable and Efficient Non-Factual Content Detection via Probe Training with Offline Consistency Checking
por: Zhang, Xiaokang, et al.
Publicado: (2024)
por: Zhang, Xiaokang, et al.
Publicado: (2024)
Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis
por: Zhu, Kejian, et al.
Publicado: (2025)
por: Zhu, Kejian, et al.
Publicado: (2025)
LongWriter-V: Enabling Ultra-Long and High-Fidelity Generation in Vision-Language Models
por: Tu, Shangqing, et al.
Publicado: (2025)
por: Tu, Shangqing, et al.
Publicado: (2025)
Awaking the Slides: A Tuning-free and Knowledge-regulated AI Tutoring System via Language Model Coordination
por: Zhang-Li, Daniel, et al.
Publicado: (2024)
por: Zhang-Li, Daniel, et al.
Publicado: (2024)
íAy!, íAy!, íAy!
por: Chapa, Marta
Publicado: (2008)
por: Chapa, Marta
Publicado: (2008)
MM-THEBench: Do Reasoning MLLMs Think Reasonably?
por: Huang, Zhidian, et al.
Publicado: (2026)
por: Huang, Zhidian, et al.
Publicado: (2026)
Untangle the KNOT: Interweaving Conflicting Knowledge and Reasoning Skills in Large Language Models
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
Aligning Teacher with Student Preferences for Tailored Training Data Generation
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
Auxiliary Metrics Help Decoding Skill Neurons in the Wild
por: Zhao, Yixiu, et al.
Publicado: (2025)
por: Zhao, Yixiu, et al.
Publicado: (2025)
Explainable Few-shot Knowledge Tracing
por: Li, Haoxuan, et al.
Publicado: (2024)
por: Li, Haoxuan, et al.
Publicado: (2024)
Pre-training Distillation for Large Language Models: A Design Space Exploration
por: Peng, Hao, et al.
Publicado: (2024)
por: Peng, Hao, et al.
Publicado: (2024)
ClinSeekAgent: Automating Multimodal Evidence Seeking for Agentic Clinical Reasoning
por: Wu, Juncheng, et al.
Publicado: (2026)
por: Wu, Juncheng, et al.
Publicado: (2026)
ProcVLM: Learning Procedure-Grounded Progress Rewards for Robotic Manipulation
por: Feng, Youhe, et al.
Publicado: (2026)
por: Feng, Youhe, et al.
Publicado: (2026)
¡Ay Negrita, sálvanos!
por: Ana Ligia Rovira Ugalde
Publicado: (2010)
por: Ana Ligia Rovira Ugalde
Publicado: (2010)
VidCoM: Fast Video Comprehension through Large Language Models with Multimodal Tools
por: Qi, Ji, et al.
Publicado: (2023)
por: Qi, Ji, et al.
Publicado: (2023)
Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models
por: Lin, Nianyi, et al.
Publicado: (2025)
por: Lin, Nianyi, et al.
Publicado: (2025)
Handling Students Dropouts in an LLM-driven Interactive Online Course Using Language Models
por: Wang, Yuanchun, et al.
Publicado: (2025)
por: Wang, Yuanchun, et al.
Publicado: (2025)
On the Detectability of ChatGPT Content: Benchmarking, Methodology, and Evaluation through the Lens of Academic Writing
por: Liu, Zeyan, et al.
Publicado: (2023)
por: Liu, Zeyan, et al.
Publicado: (2023)
WildReward: Learning Reward Models from In-the-Wild Human Interactions
por: Peng, Hao, et al.
Publicado: (2026)
por: Peng, Hao, et al.
Publicado: (2026)
PairJudge RM: Perform Best-of-N Sampling with Knockout Tournament
por: Liu, Yantao, et al.
Publicado: (2025)
por: Liu, Yantao, et al.
Publicado: (2025)
Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
por: Chen, Jianhui, et al.
Publicado: (2024)
por: Chen, Jianhui, et al.
Publicado: (2024)
RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style
por: Liu, Yantao, et al.
Publicado: (2024)
por: Liu, Yantao, et al.
Publicado: (2024)
Parental Migration and Left‐Behind Children's Health‐Seeking Behaviours: Evidence From Rural China
por: Erga Luo, et al.
Publicado: (2025)
por: Erga Luo, et al.
Publicado: (2025)
TableLLM: Enabling Tabular Data Manipulation by LLMs in Real Office Usage Scenarios
por: Zhang, Xiaokang, et al.
Publicado: (2024)
por: Zhang, Xiaokang, et al.
Publicado: (2024)
LongBench v2: Towards Deeper Understanding and Reasoning on Realistic Long-context Multitasks
por: Bai, Yushi, et al.
Publicado: (2024)
por: Bai, Yushi, et al.
Publicado: (2024)
Iteratively Regularized Gradient Tracking Methods for Optimal Equilibrium Seeking
por: Qiu, Yuyang, et al.
Publicado: (2024)
por: Qiu, Yuyang, et al.
Publicado: (2024)
Shifting Long-Context LLMs Research from Input to Output
por: Wu, Yuhao, et al.
Publicado: (2025)
por: Wu, Yuhao, et al.
Publicado: (2025)
T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
por: Hou, Zhenyu, et al.
Publicado: (2025)
por: Hou, Zhenyu, et al.
Publicado: (2025)
¡Ay vida, cuánto me debes!
por: María del Coral Herrera Herrera
Publicado: (2005)
por: María del Coral Herrera Herrera
Publicado: (2005)
Ejemplares similares
-
R-Eval: A Unified Toolkit for Evaluating Domain Knowledge of Retrieval Augmented Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2024) -
ChatLog: Carefully Evaluating the Evolution of ChatGPT Across Time
por: Tu, Shangqing, et al.
Publicado: (2023) -
WaterBench: Towards Holistic Evaluation of Watermarks for Large Language Models
por: Tu, Shangqing, et al.
Publicado: (2023) -
DICE: Detecting In-distribution Contamination in LLM's Fine-tuning Phase for Math Reasoning
por: Tu, Shangqing, et al.
Publicado: (2024) -
MAIC-UI: Making Interactive Courseware with Generative UI
por: Tu, Shangqing, et al.
Publicado: (2026)