发布时间:2026/7/30 7:52:26
大语言模型真相探测遇挑战:对角线攻击揭示通用真相探测器悖论! 真相并非单一方向对大语言模型LLM探测方法的塔斯基式攻击2026年7月10日阿贝尔·扬斯马发布研究。该研究针对大语言模型真相探测的对角线攻击揭示了为何在语言模型的嵌入空间中没有一种探测方法能精准确定真相。线性之梦现代大语言模型LLM会将输入文本编码为嵌入空间中的向量。许多自然概念如性别、情感、首都城市等都对应着这个空间中的“方向”这被称为“线性表示假设”。最近有更大胆的版本提出存在一个对应“真相”的方向不少研究对此进行了探索。拥有这样的真相方向能判断文本是否真实对人工智能安全研究至关重要。于是人工智能安全研究人员通过向大语言模型输入真实和虚假陈述训练分类器来区分它们的嵌入向量这种方法效果出奇地好且有一定泛化能力。不过超人类人工智能能否在嵌入几何结构中反映命题的真实性仍有待思考。此外罗素、怀特海和希尔伯特曾希望为整个数学构建判定真理的系统方法但哥德尔的不完备定理粉碎了这个梦想数学真理无法完全通过可证明性来捕捉。关于“关于”哥德尔通过创建巧妙系统证明算术表达式可描述算术句子的性质产生了类似衔尾蛇的句子。塔斯基进一步深化悖论指出任何足够表达力的语言都不能包含其自身的完整真值谓词。图灵的停机问题也是“对角线”构造的例子。诺森·亚诺夫斯基提出通用方法处理自我指涉的悖论指出事物处理自身属性时会出现问题。基于Transformer的大语言模型也有类似操作它们将输入表示为嵌入空间中的向量方向对应各种概念且这些概念可用自然语言表达并再次输入模型。虽然并非所有嵌入空间的几何结构都对应易于用语言描述的结构但重要部分确实如此“真实性”概念也常存在。对角线攻击设 t(s) 是真相探测器对输入字符串 s 的输出考虑句子 t(“真相探测器对这个句子的评分结果为 FALSE。”) 会发现无论句子真假都会形成悖论这表明不存在通用的真相探测器。“足够表达力来描述探测器及其输出”的门槛很低英语显然满足条件。作者为 Qwen3.5 - 4B 模型创建了简单真相探测器通过均值差异方法训练在对120个标记的示例句子进行训练后该探测器在36个保留的评估句子上的准确率达到了94%AUC为0.98唯一误标记的句子是算术句子。但对于对角线攻击句子评分毫无意义且波动很大不过一些自我指涉的句子有明确真值模型能准确评分。定点解决方案所有类似说谎者悖论的场景都是劳威尔定点定理的例子。该定理指出当系统包含足够表达力的评估器时评估器目标上的每个自映射都必须有一个定点。由于 {TRUE, FALSE} 集合上的否定操作没有定点所以不存在这样的评估器。若将定义域扩展到整个区间 [0, 1]否定操作在 1/2 处有一个定点标准的说谎者悖论句子可得到0.5的自洽估值。但这不能解决所有对角线攻击因为并非 [0, 1] 上的所有函数都有定点。若只允许 [0, 1] 上的连续函数虽能保证有定点但会牺牲表达力导致新的说谎者悖论。所以没有令人满意的方法抵御对角线攻击也不存在通用真相探测器。总结在简单情况下投影到单一方向的真相探测器效果出奇地好但它们不是真相预言机。在 [0, 1] 上采用连续真值操作的分级真值语义可将普通说谎者句子的定点值设为 1/2 但需限制对精确真值分数的明确断言。传统的逻辑真值探测器不会因输出在 [0, 1] 范围内就实现反射性语义。虽然认为超人类人工智能可作为真相预言机的想法看似荒谬但有两个理由值得认真对待一是绝大多数人已将其用于取代标准谷歌搜索结果很多讨论最终将真相决定权交给人工智能二是有人相信存在柏拉图式的表示空间所有模型会收敛到该空间并代表世界“真实”状态。本文认为这将导致悖论。最后强调真相探测器虽不能成为通用真相预言机但能帮助理解模型行为发现模型错误行为真相不是人工智能嵌入空间中的一个方向也不会阻碍人工智能对齐研究取得进展。

相关新闻

2026/7/30 7:52:26

Matlab实现Mann-Kendall趋势与突变检验:原理、代码与实战

1. 从数据波动到趋势突变:为什么我们需要MK检验?如果你处理过长时间序列数据,比如几十年的气温记录、河流的年径流量、或者股票市场的月度指数,你可能会发现一个共同点:数据很少会一成不变地沿着一条直线发展。更多时候…

2026/7/30 7:47:26

南邮数学实验Matlab模块一参考答案:从基础绘图到算法实现

1. 项目缘起与定位:一份参考答案的诞生最近在整理资料时,翻出了当年在南邮上《数学实验》这门课的一些笔记和作业。这门课对于很多理工科学生来说,是第一次系统性地将数学理论与计算机实践相结合,而Matlab作为核心工具&#xff0c…

2026/7/30 7:47:26

LinuxDay5-Vim编辑器

Linux 基础 Day5:Vim 编辑器 — 从「进得去出不来」到写 C 代码 系列:粤嵌嵌入式培训学习笔记 (第 5 篇) 上一篇:Linux 基础 Day4:用户管理 用户组 权限管理 环境:Ubuntu 22.04 Vim 8.2 | 2026年7月29日 ① 概览 Li…

2026/7/30 8:42:29

英特尔i5-1035G1处理器性能实测与CPU-Z深度解析

这次我们来详细测试一下英特尔酷睿 i5-1035G1 处理器在默频状态下的性能表现。作为英特尔第十代酷睿移动处理器的一员,i5-1035G1 主要面向轻薄本市场,采用10nm制程工艺,集成Intel UHD Graphics核显,在功耗控制和日常办公性能方面有…

2026/7/30 8:42:29

AI赋能视频生产,为何效率反而下降?

最近,一个令人困惑的现象在行业里蔓延:明明引入了最前沿的视频生成工具,不少制作团队的实际产出效率不升反降。据一份2024年的行业调研显示,超过六成尝试深度应用AI视频工具的团队反馈,单个视频项目的平均制作周期反而…

2026/7/30 8:42:29

2026年深圳搬家首选:口碑载道的帮搬团队揭秘

随着城市化进程的不断推进,越来越多的人选择在深圳这座繁华的城市安家落户。然而,搬家过程中的种种烦恼却让人头疼不已。今天,我们就来揭秘一家在深圳口碑极佳的搬家服务公司——深圳芝麻理想家家政服务有限公司(以下简称“深圳芝…

2026/7/30 8:37:29

为什么论文查重过了但AI检测没过?2026年AIGC检测原理分析

明明查重率已经降到20%以下了,信心满满去做AI检测,结果AIGC率飙到50%甚至更高——这种"查重过了但AI没过"的情况,2026年毕业季简直太常见了。 很多同学第一反应是:我又没全篇用AI写,怎么就被查出来了&#x…

2026/7/29 22:32:30

PDF合并与动态水印的工程化方案:2026国内免费工具实测对比

一、背景与测试方案 在实际项目交付中,PDF文件合并与版权保护水印的叠加是一个高频但容易被低估的技术需求。典型的处理链路涉及:多源PDF的文件流合并、页面级水印渲染(含透明度混合与图层叠加)、输出文件体积控制。看似简单的操作…

2026/7/30 0:01:39

[GESP202606 四级] 扫雷

B4557 [GESP202606 四级] 扫雷 https://www.luogu.com.cn/problem/B4557 中国计算机学会(CCF)2026年6月C四级讲解——扫雷 https://www.bilibili.com/video/BV1MCMg6AEXR/ B4557 [GESP202606 四级] 扫雷 https://www.bilibili.com/video/BV1ZKTj6ZEVh/ 2…

2026/7/30 0:01:39

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南

Windows驱动存储终极清理工具:DriverStoreExplorer完全指南 【免费下载链接】DriverStoreExplorer Driver Store Explorer 项目地址: https://gitcode.com/gh_mirrors/dr/DriverStoreExplorer 您是否曾因Windows系统盘空间不足而烦恼?是否遇到过设…

2026/7/29 13:12:43

3个高效策略:快速掌握Axure中文界面配置

3个高效策略:快速掌握Axure中文界面配置 【免费下载链接】axure-cn Chinese language file for Axure RP. Axure RP 简体中文语言包。支持 Axure 11、10、9。不定期更新。 项目地址: https://gitcode.com/gh_mirrors/ax/axure-cn 还在为Axure RP的英文界面感…