SRD-GUARD: A Defense Framework of LLMs via Semantic Rewriting and Joint Multi-Model Scoring for Latent Intent Exposure
为解决大型语言模型在面对伪装攻击时的安全问题,提出SRD-GUARD框架,通过语义重写和多模型联合评分来揭露隐藏意图。
0 citationsRead paper
为解决大型语言模型在面对伪装攻击时的安全问题,提出SRD-GUARD框架,通过语义重写和多模型联合评分来揭露隐藏意图。
本文提出了一种基于行为指标的框架,用于监测和评估人工智能系统可能带来的灾难性威胁,并采用网络安全和国家安全领域的成熟方法来建立明确的度量标准。
为解决大型语言模型在面对伪装攻击时的安全问题,提出SRD-GUARD框架,通过语义重写和多模型联合评分来揭露隐藏意图。
本文提出了一种基于行为指标的框架,用于监测和评估人工智能系统可能带来的灾难性威胁,并采用网络安全和国家安全领域的成熟方法来建立明确的度量标准。