DiffuGuard: How Intrinsic Safety is Lost and Found in Diffusion Large Language Models (ResponsibleFM @ NeurIPS 2025) 2026-02-03 #深度学习 #大模型
One-shot Optimized Steering Vector for Hallucination Mitigation for VLMs (arxiv 2026) 2026-02-02 #深度学习 #大模型
A Unified Definition of Hallucination, Or: It's the World Model, Stupid (arxiv 2025) 将不同领域(翻译、摘要、QA、Agent、多模态)中的幻觉统一定义为”不准确的(内部)世界建模“。 2025-12-31 #深度学习 #大模型
JustRL: Scaling a 1.5B LLM with a Simple RL Recipe (arxiv 2025) 清华大学、伊利诺伊大学厄巴纳-香槟分校和上海人工智能实验室出品。 2025-12-28 #深度学习 #大模型