谁在说话,比说了什么更重要:意大利议会记录里的AI偏见问题

2026年2月,意大利众议院第十九届立法会期已经产生了608场全体会议、6010场辩论、40416次发言。
这是一个什么概念?如果你想搞清楚意大利议会各党派对司法改革到底是什么态度,理论上你需要翻遍这四万多条发言记录,找出哪些是真正谈司法改革的,再分辨哪些议员的话有分量,哪些只是随口一提。
一个正常人不可能做完这件事。于是很自然地,大家会想到用大语言模型来帮忙读、帮忙总结。但这里有一个问题,绝大多数人根本没意识到:**把AI直接怼到政治文本上,会捅出三个篓子**,而且这三个篓子在别的场景里可能无伤大雅,一旦发生在议会记录这种严肃场合,就是要出大事的。
来自米兰比可卡大学的研究团队做了一件事,他们造了一个叫ParliamentRAG的系统,专门用来啃这块硬骨头。这篇论文被2026年语义网国际会议(ISWC)的应用赛道接收,讲的就是他们怎么解决"AI读议会记录会闯的祸"这件事。
三个AI不会告诉你的坑
先说清楚,用AI总结议会辩论,具体会踩到哪三个坑。
第一个坑,是话多的人会显得更"有理"。
议会里总有那么几个议员特别爱发言,一个话题能讲八遍。如果你让AI基于发言内容做总结,它天然就会更多引用这些话痨议员,因为语料库里他们的话最多,被检索到的概率也最高。但发言次数多,不代表这个人的观点更有代表性,也不代表他的意见更值得听。这就像一个班级投票选班长,结果统计的时候把"举手次数"当成了"支持人数",一个人举了十次手就被算成十票。
第二个坑,是AI分不清"随口提一嘴"和"真懂行"。
一个议员如果只是在某次发言里顺带说了句和司法改革相关的话,跟一个长期在司法委员会任职、亲自签署过相关法案的议员,在纯粹基于文本相似度的检索系统眼里,可能是等价的。因为传统的检索只看这段话和你的问题在语义上像不像,完全不看这个人背后的身份、经历、专业背景。
第三个坑,是引用出错。
大语言模型有个广为人知的毛病,叫做"幻觉"(hallucination,指模型生成看起来合理但实际上不存在或不准确的内容)。放在写小说、聊闲天里问题不大,但放在"某某议员说了什么"这种引语场景,哪怕只有5%的引用是编造或者走样的,对于媒体和公众来说都是不可接受的,因为这可能直接构成对政治人物的误解甚至诽谤。
这三个问题合在一起,构成了论文标题里"Who Speaks Matters"(谁在说话,很重要)这句话的全部分量。
解法的骨架:知识图谱先行
研究团队没有直接扑向"怎么调prompt让AI说得更公平",而是先干了一件基础工作:把所有议会数据,重新组织成一张知识图谱。
知识图谱:一种把信息组织成"实体+关系"网络的数据结构,比如"某议员"是一个实体,"属于某党派"是一条关系,这种结构天然适合表达复杂的、带时间属性的社会关系网络。
为什么不能直接把发言文本扔进一个普通数据库了事?这里有个具体的技术难题:议员的党派归属是会变的。有人中途换党,有人换了几次。如果用普通表格存储"议员-党派"这种一对一关系,没法处理"这个议员2023年属于A党,2024年跳到了B党"这种带时间戳的动态归属。而知识图谱天生擅长存储带属性的关系,比如"属于某党派"这条边可以附带"起始日期"和"结束日期"两个属性。
这就好比你管理一个员工花名册,如果只用一张Excel表记录"某某属于某部门",一旦有人调岗,你要么覆盖旧记录(丢失历史),要么手动加一堆备注列(混乱不堪)。但如果换成一个能记录"任职时间段"的系统,调岗记录就是一条自然的新增数据,历史轨迹完整保留,还能随时查任意时间点这个人到底在哪个部门。议员的党派归属问题,本质上是一模一样的道理。
最终,研究团队构建出的这张图,包含了387位议员、64位曾发言的政府成员、10个议会党团、80个委员会、608场会议、6010场辩论、40416次发言,总共232755个节点、488487条关系。所有发言被切成151073个文本片段(chunk),作为检索的最小单位。
每个片段还带着一个精确到字符的位置信息(起始字符、结束字符),这个设计后面会解释它有多关键。此外,团队还补充了知识图谱里原本没有的信息:每位议员的教育背景和职业信息,这些信息被转换成向量(embedding,一种把文字或概念转换成一串数字的技术,让计算机能计算两段内容语义上"有多像")存进图谱里,作为后续判断"这个人是不是这个领域的专家"的重要依据。
谁更懂:动态计算的"权威分数"
这是整篇论文最有意思的设计,一个叫做"权威分数"(authority score)的东西。
权威分数:一个根据当前问题动态计算的分数,用来衡量某位议员在这个特定话题上的发言分量有多重,而不是一个固定不变的"名气值"。
这里的"动态"两个字非常关键。传统的网页排名算法,比如大家熟悉的PageRank(谷歌搜索引擎早期用来给网页打分的算法),给每个网页算出来的分数是固定的,不管你搜什么关键词,这个网页的"权重"都一样。但议会场景完全不是这么回事:一个议员可能在司法领域是专家,但在环境政策上就是个门外汉。如果用一个固定分数去衡量他,等于说"这个人说话总是很有分量",这明显不对。
于是ParliamentRAG给每个议员计算的权威分数,是"议员"和"当前查询问题"两者共同决定的结果。具体来说,这个分数由六个部分加权相加:职业背景(权重0.15)、教育背景(权重0.10)、委员会任职(权重0.25)、签署过的立法法案(权重0.20)、发言历史(权重0.25)、机构角色比如党团主席(权重0.05)。
举个例子,如果你问"环境政策"相关的问题,一个学法律出身、常年在司法委员会任职的议员,在这个话题上的权威分数就会很低,因为他的职业背景、委员会经历和这个问题几乎不搭边。但如果换成问司法改革,同一个人的分数就会飙升。
这套打分机制还考虑了两个细节,都值得单独说一说。
第一个是时间衰减。议员十年前说过的话,跟他上个月刚说的话,重要性应该不一样。系统对立法活动和发言记录都做了时间衰减处理,让近期的表态权重更高,避免一个人早年间随口说过的话被过度放大。
第二个是党派归属的时点绑定。如果一个议员曾经属于A党,后来跳槽去了B党,系统在计算他当前的权威分数时,只会统计他在当前所属党派下的活动,防止一个人历史上的跳槽经历干扰了他现在代表哪个党派发声这件事的准确性。
这套权威分数在整个系统里的权重其实被刻意压得很低,只占0.05(相比之下语义相关性权重是0.35)。研究者的考虑很实际:如果权威分数权重太高,那些来自小党派、没有显赫职务但确实认真参与过讨论的议员,很容易被系统边缘化,因为小党派天然缺少"委员会主席"这类机构角色。权威分数的作用是在同等相关的候选里挑出更懂行的人,而不是让"谁官大"决定谁能被听见。
双通道检索:两条腿走路才不会瘸
光有权威分数还不够,检索这一步本身也得设计得聪明一点。
论文里提出了"双通道检索"的思路,一条叫密集通道(dense channel),一条叫图谱通道(graph channel)。
密集通道:通过计算问题和发言片段之间的语义向量相似度,找出内容上相关的发言,这条通道完全不关心是谁说的。
图谱通道:先找到和问题相关的立法法案,再通过图谱关系,找出谁是这些法案的主签署人或联署人,进而找到这些人的相关发言。
为什么非要两条通道一起用?密集通道有个致命弱点,它没法区分"随口提一句"和"真正深度参与"。一个议员可能只在某次辩论里带过一嘴某个法律条款,语义上跟你的问题很像,就被密集通道捞出来了;但另一个议员可能亲自主导起草了相关法案,深度参与了整个立法过程,只是恰好没在那次发言里用到跟你问题一模一样的措辞,密集通道反而可能漏掉他。
这就好比你想找一个真正懂茶的人问问题,如果只靠"谁在朋友圈发过茶相关的内容最多"来判断,你可能找到的是一个天天发九宫格晒茶具照片但其实不太懂茶道的人,而真正每天研究茶叶发酵工艺、写过茶叶论文的人,因为发朋友圈少,反而被漏掉了。图谱通道的作用,就是绕开"发言频率"这个表面信号,直接去看"谁真正签了字、动了手"的实际参与证据。
两条通道并行跑完之后,检索到的结果会合并、去重,然后用一个综合打分公式重新排序,这个公式里就包含了前面说的权威分数、还有相关性、多样性、党团覆盖度、内容显著性这几个维度。
生成阶段:四步走,确保每个党派都被听见
检索排序做完之后,进入生成环节。这里ParliamentRAG采用了一个四阶段流水线:分析、撰写、整合、引用。
第一步"分析",把用户的问题拆解成一系列具体的子命题,并且明确标出:要回答这些子命题,每个党派分别需要哪些证据支持。这一步的用意是提前把"覆盖所有党派"这件事写进任务清单里,而不是等生成完了才发现漏了谁。
第二步"撰写",为每一个党派单独生成一段内容,依据是这个党派对应的、按权威分数排好序的证据材料。这里有个细节特别值得注意:如果某个党派确实没有找到相关证据,系统会明确说"没有找到该党派的相关表态",而不是硬凑一段内容出来。
这个设计背后的逻辑其实很朴素。如果你为了让报告看起来"面面俱到",硬让AI给每个党派都编一段像模像样的话,那些本来就没怎么参与这个话题讨论的党派,反而会被系统"发明"出一套并不存在的立场。宁可承认"我们没找到",也不要用AI的编造能力去填补证据的空白。
第三步"整合",把各个党派的分段内容拼接成一篇连贯的叙述文章,同时保留所有引语的占位符不被改动。
第四步"引用",这是全篇设计里最硬核的一环。系统在这一步不允许大语言模型自己写引语文字,模型只能生成一个"占位符",标记引语在原文里的字符起始和结束位置,然后系统用之前存好的精确字符坐标,把占位符替换成原文里一字不差的原始文本。
这个设计直接从源头堵死了"引用出错"这个问题。因为引语从来不是AI"写"出来的,而是从原始记录里"抠"出来的。这就像你请一个助理帮你整理会议纪要,如果让助理凭记忆复述某人说的话,哪怕他记忆力再好,也难免会有措辞上的偏差;但如果要求助理必须用剪刀从会议录音转写稿上剪下原句贴到文档里,那这句话就绝对不会走样,因为它压根就不是被重新写出来的,而是被物理搬运过去的。
论文里给出的实验数字印证了这个设计的价值:ParliamentRAG的引语忠实度(Quotation Faithfulness)达到了1.00,也就是100%的引语都能在原文里找到一字不差的对应,而对照组NotebookLM是0.95,意味着大约5%的引用存在偏差。
拿谁来比?选了一个"作弊局"里的强敌
光说自己的系统好没有意义,得找个对手比一比。研究团队选择了谷歌的NotebookLM作为对比基准。
NotebookLM:谷歌推出的一款基于用户上传文档进行问答和总结的AI工具,背后使用的是Gemini系列大模型。
选这个对手其实挺有讲究。首先,目前还没有其他同类系统在同行评审的学术出版物里公开发表过,NotebookLM是普通人真的能上手用的现成工具;其次,NotebookLM背后跑的是当时(2025年11月发布)比ParliamentRAG所用的GPT-4o(2024年5月发布)更新、在公开排行榜上排名更高的Gemini 3模型。
这里有个很关键的实验设计问题:ParliamentRAG能在全部151073个文本片段里自由检索,但NotebookLM作为一个通用工具,没法直接吞下这么庞大的原始数据。所以研究团队采取了一个折中方案,针对每个测试话题,手工准备一个专属的"文档集"喂给NotebookLM:大约150个和话题相关的片段(这些片段实际上是用ParliamentRAG的检索排序流程挑出来的),再加上大约150个"干扰片段"(来自相似但不同的话题)。
这个设计相当于模拟了"一个专业分析师提前帮NotebookLM筛选好了资料"这种理想情况。换句话说,这场比较对NotebookLM其实是相当友善的,甚至可以说是让NotebookLM打了一场"降低难度"的比赛,因为普通用户根本不可能自己去四万条发言记录里手动挑出150条相关材料。研究者自己也在论文里坦诚承认了这一点,这场对比测的其实是"检索结果已经准备好之后,生成质量谁更强",而不是端到端的完整检索能力比拼。哪怕在这样对自己不算特别有利的设定下,ParliamentRAG依然在几个关键指标上占了上风,这个结果的含金量反而更高。
数据说话:谁赢在哪里
研究团队设计了两层评估体系,一层是自动化指标,一层是人工专家打分。
先看自动化指标。团队从51个通过公众问卷收集来的政策话题里,精选出15个覆盖不同争议程度和讨论热度的议题,涵盖司法与公民权利、体制改革、移民、劳动福利、环境能源、科技、国防外交、经济金融这八大领域。
| 指标 | ParliamentRAG | NotebookLM | 差距 |
|---|---|---|---|
| 党团覆盖率(Groups with Quotation) | **0.97** | 0.95 | +0.02 |
| 完整度(Completeness) | 0.99 | **1.00** | -0.01 |
| 引语忠实度(Quotation Faithfulness) | **1.00** | 0.95 | +0.05 |
| 平均权威分(Mean Authority) | **0.53** | 0.52 | +0.01 |
党团覆盖率衡量的是"有多少个党团在回答里至少被引用了一次发言",ParliamentRAG拿到了0.97,也就是说平均下来,十个党团里差不多能覆盖到9.7个。这个数字没能做到100%的原因也很直白:如果检索阶段压根没找到某个党团的相关发言,生成阶段再怎么设计规则也变不出话来。
引语忠实度这一项的差距最能说明问题。5个百分点听起来不多,但换算成实际场景就是:每生成20条引语,NotebookLM就有大约1条对不上原文。对于一个媒体人或者研究者来说,这种概率意味着每次引用都得亲自去核对原文,否则就有引错话、错怪人的风险。而ParliamentRAG因为架构层面就杜绝了这个问题,天生就不需要这道核对手续。
再看人工评估的结果。研究团队请了六位领域专家,都不是论文作者,包括议会记者、议会助理、政策分析师,平均从业经验7.2年,用A/B盲测的方式,对两个系统在九个维度上打1到5分,总共收集了67组配对评价。
| 评价维度 | ParliamentRAG均分 | NotebookLM均分 | ParliamentRAG获胜占比 | 平局占比 | NotebookLM获胜占比 |
|---|---|---|---|---|---|
| 回答质量 | 4.04 | **4.30** | 30% | 25% | 45% |
| 回答清晰度 | 4.27 | **4.51** | 22% | 48% | 30% |
| 回答完整性 | **4.12** | 4.09 | 24% | 55% | 21% |
| 引语相关性 | **4.37** | 4.36 | 24% | 54% | 22% |
| 平衡感知 | **4.66** | 4.48 | 21% | 72% | 7% |
| 平衡公正性 | **4.67** | 4.66 | 12% | 78% | 10% |
| 信源相关性 | **4.07** | 3.84 | 33% | 48% | 19% |
| 信源权威性 | **4.21** | 4.00 | 30% | 57% | 13% |
| 信源覆盖度 | **4.64** | 4.39 | 25% | 70% | 5% |
| 总体满意度 | 4.24 | **4.27** | 31% | 42% | 27% |
这张表读起来很有意思,两个系统的胜负呈现出非常明显的分工。
NotebookLM在"回答质量"和"回答清晰度"这两项遥遥领先,尤其是在"回答质量"这一项上,被专家直接偏好的比例达到45%,比ParliamentRAG的30%高出不少。这大概率是因为NotebookLM背后的Gemini 3模型本身文字生成能力更强,加上它是一次性生成一整篇连贯文章,行文更自然流畅。
但反过来,在几乎所有和"信息来源"相关的维度上,ParliamentRAG碾压式领先。尤其是"信源覆盖度"这一项,ParliamentRAG被偏好的比例是25%,NotebookLM只有5%,换算成偏好比例大约是5.7比1。"信源权威性"和"信源相关性"两项也是类似的态势。
最耐人寻味的是"总体满意度"这一项,两边几乎打平,4.24对4.27。这说明专家们虽然清楚地感受到两个系统各有短板,但综合下来觉得它们提供的价值差不多,只是价值来源完全不同:一个靠文笔取胜,一个靠信源扎实取胜。
论文里还提到,虽然所有这些差异经过统计学上的多重比较校正(Holm-Bonferroni校正,一种防止在做多次统计检验时"撞大运"式误判显著性的数学修正方法)之后都没有达到严格意义上的"统计显著",但用Cohen's d(一种衡量两组数据差异大小的效应量指标)来看,信源相关性和信源覆盖度都达到了0.35,属于中等偏上的效应量,说明这个差异虽然样本量不够大导致没能通过严格检验,但趋势是真实且一致的。
评估最后还问了专家一个问题:完成整个测试后,你会不会向同行推荐这样一套系统?在默认答案设为"不会"的前提下,专家们有72%的比例给出了肯定回答。这个数字挺说明问题,说明即便这套系统还有不少可以打磨的地方,专业用户依然认为它解决了真实的痛点。
这套设计到底解决了什么根本矛盾
回过头看整个ParliamentRAG的设计思路,其实是在解决一个很本质的矛盾:AI擅长的是"从海量文字里提炼出流畅的总结",但政治场景要求的是"忠实地反映真实存在的多元立场",这两件事有时候是打架的。
一个纯粹追求"读起来通顺"的AI系统,天然会倾向于选择表达最清晰、说得最多、语料最丰富的那些声音,因为这些声音更容易被检索到、更容易被整合成流畅的段落。但这恰恰会系统性地压制那些发言较少、来自小党派、但同样代表着真实民意的声音。
ParliamentRAG的做法,是把"多方声音必须被听见"这条原则,从一句道德倡议变成了架构里硬性的执行规则:每个党团单独生成一段内容,找不到证据就明说找不到,引语必须从原文字符坐标里抠出来而不能靠AI凭空生成。这些设计牺牲了一部分行文的自然流畅感,换来的是可验证、可追溯、结构上更公平的输出。
这套思路其实可以推广到很多场景。任何一个需要综合多方意见、且各方话语权本身就不均衡的领域,比如企业内部的员工意见收集、社区居民议题讨论、甚至是产品用户反馈的自动汇总,都面临同样的问题:声音大的人不代表说得对,说得多的人不代表最有代表性。ParliamentRAG的核心思路,本质上提供了一个可以借鉴的模板,先把"谁有资格被听见""如何避免被声量大的人主导"这些原则显式地写进系统架构里,而不是寄希望于给AI一个"请保持公正"的提示词就能自动实现公平。
写在后面
读这篇论文时,最触动我的一点是那个"没找到证据就明说没找到"的设计。这个决定听起来平淡无奇,但它背后其实是一种克制。绝大多数追求"用户体验好"的AI产品,遇到信息缺口时的本能反应是想办法圆过去,让输出看起来完整、专业、无懈可击。ParliamentRAG反其道而行,宁愿在报告里留一个"这里没有材料"的空白,也不让AI去填补这个空白。这种克制在商业产品逻辑里其实是反直觉的,因为用户通常不喜欢看到"我不知道",但在严肃的公共信息场景里,这种诚实恰恰是信任的基础。
另一个让我反复琢磨的细节,是权威分数权重被刻意设得很低,只有0.05。研究者其实完全可以把这个权重调得更高,让"专家"更集中地占据舞台,报告读起来会显得更"权威"、更有说服力。但他们没有这么做,理由是担心这样会让小党派的声音被进一步边缘化。这其实是一个价值判断,不是纯技术判断:在"让报告显得更专业"和"让弱势声音有机会被听见"之间,他们选择了后者。这种选择在论文里只用了一句话带过,但如果你真的理解议会政治的生态,会知道这一句话背后是对"多数派碾压少数派"这个老问题的一次刻意抵抗。
一个还没被回答的问题是,这套权威分数的权重目前完全靠人工经验设定,论文自己也承认这一点。如果未来换成从数据里学出来的权重,会不会又悄悄引入新的偏差,比如让历史上发言多、资历老的议员系统性地获得更高分数?公平这件事,好像永远是在拆掉一个偏见的同时,得提防新的偏见钻进来。
Q&A
Q1:ParliamentRAG是什么?
A:ParliamentRAG是米兰比可卡大学团队开发的一个RAG(检索增强生成)系统,专门用来分析意大利众议院的议会辩论记录,能针对某个政策话题,自动生成涵盖各个党派立场的多角度摘要,并保证引语一字不差地来自原始发言记录。
Q2:ParliamentRAG和NotebookLM相比谁更好?
A:两者各有胜场。NotebookLM在回答的流畅度和清晰度上更受专家青睐,但ParliamentRAG在引语忠实度(100%对95%)、党团覆盖率、信源权威性和信源覆盖度上明显领先,总体满意度两者基本持平。
Q3:ParliamentRAG怎么解决AI引用出错的问题?
A:系统在生成引语时不让AI自己写引用文字,AI只生成一个标记引语在原文中位置的占位符,然后系统用预先存储好的精确字符坐标,把占位符替换成原文中一字不差的文本,从架构层面杜绝了引用编造或走样的可能。