Bear
  • 首页
  • 目录
  • 标签
  • latex识别
  • 每日arxiv
  • 关于
顽石从未成金,仍愿场上留足印。

Trap: Mitigating Poisoning-Based Backdoor Attacks by Treating Poison With Poison

IEEE Transactions on Dependable and Secure Computing(CCF A)
2026-06-10
#深度学习 #大模型

Hallucination as Exploit: Evidence-Carrying Multimodal Agents

(arxiv 2026)
2026-06-01
#深度学习 #多模态 #大模型

Finding the Correct Visual Evidence Without Forgetting: Mitigating Hallucination in LVLMs via Inter-Layer Visual Attention Discrepancy

(ICML 2026)
2026-05-29
#深度学习 #大模型

IN-CONTEXT SHARPNESS AS ALERTS: AN INNER REPRESENTATION PERSPECTIVE FOR HALLUCINATION MITIGATION

(PMLR 2024)
2026-05-28
#深度学习 #大模型

CYBER-ZERO: Training Cybersecurity Agents without Runtime

(ICLR 2026)
2026-05-27
#深度学习 #大模型

S0 Tuning: Zero-Overhead Adaptation of Hybrid Recurrent-Attention Models

(arxiv 2026)
2026-05-21
#深度学习 #大模型

Where Does Reasoning Break? Step-Level Hallucination Detection via Hidden-State Transport Geometry

(arxiv 2026) motivation正确的推理过程会在一个局部连贯的稳定流形(Manifold)中移动 。当模型产生第一个推理错误(幻觉)时,在隐藏状态空间中会表现为一种局部且明显的传输成本偏移(Transport Excursion),即轨迹偏离了正确的流形 。 方法为了捕捉这种几何偏移,作者设计了一个两阶段架构:一个非部署的“教师模型”(用于探索理论上限)和一个可实际部署的“学生
2026-05-20
#深度学习 #大模型

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

(arxiv 2026) 有点类似openai翁家翌(jiayi weng)提出的Learning Beyond Gradients。
2026-05-11
#深度学习 #大模型

Detecting Contextual Hallucinations in LLMs with Frequency-Aware Attention

(ICML 2026)
2026-05-06
#深度学习 #大模型

SwiftSage: A Generative Agent with Fast and Slow Thinking for Complex Interactive Tasks

NeurIPS 2023 (spotlight)
2026-04-25
#深度学习 #大模型
123456…39

搜索

LJX Hexo
博客已经运行 天