SIGIR2024:大语言模型与信息检索的未来机遇与挑战

随着大语言模型的发展,其在信息检索领域的应用引发关注。研究背景是当前搜索引擎有局限,而大语言模型虽有优势但也有不足。重要意义在于探索如何结合两者优势,提升信息检索的效率和质量,为未来信息检索系统的发展提供思路和方向,推动该领域的研究与应用进步。

我们翻译解读最新论文,文末有论文信息。

作者:张长旺,图源:旺知识

近年来大语言模型在自然语言处理任务中表现出色,为信息检索带来新机遇,但也存在如幻觉等问题。文章对比其与传统语言模型的优劣,阐述了应用于当前搜索引擎改进(如弥补词汇差距、明确用户意图等)和下一代搜索引擎构建(提出可解释概率检索模型)的方式,认为未来信息检索系统将是基于大语言模型的智能体与搜索引擎协作,最后给出了相关未来研究方向。

摘要&解读

近年来,大语言模型(LLMs)在执行许多自然语言处理任务方面取得了巨大成功,表现令人瞩目,包括诸如问答和文本摘要等直接服务用户的任务。它们为信息检索(IR)研究和应用的变革带来了前所未有的机遇。然而,诸如幻觉等问题损害了它们的可信度,限制了它们在实际应用(尤其是高风险应用,其中信任至关重要)中的实际效用。在将大语言模型应用于信息检索时,我们如何既能利用其优势,又能减轻其弱点带来的风险?将大语言模型应用于信息检索的最佳机会是什么?为了充分利用这些机会,我们未来需要应对哪些主要挑战?鉴于大语言模型的预期增长,未来的信息检索系统会是什么样子?大语言模型最终会取代信息检索系统吗?在这篇观点性论文中,我们探讨了这些问题并提供了初步答案。我们认为大语言模型无法取代搜索引擎,未来的大语言模型需要学习如何使用搜索引擎,以便能够代表用户与搜索引擎进行交互。最后,我们给出了一系列在将大语言模型应用于信息检索方面有前景的未来研究方向。

  • 研究背景: 大语言模型在自然语言处理任务取得成功,但存在如幻觉、无法获取最新信息等问题,而传统搜索引擎虽被广泛使用但在理解自然语言、明确用户意图等方面存在局限,在此背景下展开对大语言模型在信息检索中应用的研究。

  • 研究贡献: 提出可解释概率检索模型,将相关性匹配分解为属性匹配,为信息检索提供新的思路;探讨大语言模型在模型估计中的应用,利用其能力提升信息检索的准确性和可解释性;提出未来信息检索系统是智能体与搜索引擎协作的新架构。

  • 实现设计: 通过对大语言模型的微调、提示等操作实现其在弥补词汇差距、明确用户意图、总结搜索结果等方面的功能;利用大语言模型构建可解释概率检索模型和可解释神经网络匹配模型,并通过搜索日志数据等进行训练。

1. 引言

近年来,大语言模型(LLMs)在执行许多自然语言处理任务方面取得了巨大成功,包括像问答和文本摘要等直接服务用户的任务。虽然统计语言模型早在几十年前就已应用于信息检索,但这些新的大语言模型在表示学习能力上远超传统语言模型,使其能够在语义上理解自然语言并生成流畅且有意义的自然语言文本。此外,随着模型规模的增加,性能不断提升,GPT - 4在许多任务上表现极为出色。而且,基础模型可以通过指令或极少数示例进行微调以执行许多不同的任务,它们还能够进行上下文学习并从人类反馈中学习。

作为新一代智能技术,大语言模型为信息检索研究和应用的变革带来了前所未有的机遇。事实上,正如近期关于该主题的一项调查所引用的大量参考文献(231篇参考文献)以及该领域许多有影响力的论文所表明的那样,使用大语言模型进行信息检索的研究已经迅速增长。

然而,现有的将大语言模型应用于信息检索的工作大多侧重于利用大语言模型改进当前的搜索引擎。该调查将大多数现有工作分为四个方向,分别对应于使用大语言模型改进查询重写器、检索器、重新排序器和阅读器。但是,现有工作很少关注大语言模型从长远来看将如何影响信息检索的未来这一重要问题。一个例外是由一大批作者共同撰写的近期报告,作者在其中对大语言模型在信息检索中的未来应用进行了系统讨论,并提出了一个包括信息检索系统、大语言模型和人类用户协作的框架。然而,这是一个高级框架,大多符合当前的搜索范式,缺乏详细的技术愿景。

在本文中,我们以前人的工作为基础,从更具前瞻性的视角出发,考虑到大语言模型的未来发展,研究其对信息检索研究和应用的长期影响,并试图为信息检索研究制定一个详细的技术愿景,以充分利用大语言模型的优势。具体而言,我们旨在解决以下问题:1)在将大语言模型应用于信息检索时,我们如何既能利用其优势,又能减轻其弱点带来的风险?(诸如幻觉等问题损害了大语言模型的可信度,限制了它们在实际应用中的实际效用,尤其是在高风险应用中,信任至关重要。)2)将大语言模型应用于信息检索(无论是改进当前一代搜索引擎还是开发下一代搜索引擎)的最佳机会是什么?3)为了充分利用这些机会,我们未来需要应对哪些主要挑战?4)鉴于大语言模型的预期增长,未来的信息检索系统会是什么样子?大语言模型最终会取代信息检索系统吗?

我们对所有这些问题进行了探讨并提供了初步答案。我们讨论了使用大语言模型改进当前搜索引擎和开发下一代搜索引擎的技术思路。我们认为大语言模型未来无法取代搜索引擎;相反,未来的大语言模型需要学习如何使用搜索引擎,以便能够代表用户与搜索引擎进行交互。未来的信息检索系统可能是由大语言模型驱动的智能体,以交互方式提供个性化任务支持。最后,我们给出了一系列在将大语言模型应用于信息检索方面有前景的未来研究方向。

2. 用于信息检索的大语言模型概述

在本节中,我们对将大语言模型应用于信息检索的机遇和挑战进行了高层次的概述。我们首先分析与传统语言模型相比,大语言模型带来的新机遇。

2.1 大语言模型与传统语言模型对比

为了理解大语言模型的优势和劣势以及它们为信息检索研究和应用带来的独特机遇,将大语言模型与传统语言模型(如 n - gram 语言模型或主题模型)进行比较是很有帮助的。

传统语言模型通常具有可解释的参数。例如,一元语言模型具有对应于单词概率的参数,这使我们能够解释和理解该模型所捕捉的主题。例如,一个给“体育”和“足球”等单词赋予最高概率的模型将表明与体育相关的主题。同样,像 PLSA 或 LDA 这样的混合语言模型具有表示多个主题的单词分布以及每个文档中主题覆盖概率的参数。传统语言模型的可解释性使它们能够用于分析文本数据,以获得文本的可解释语义表示,并且可以潜在地展示给用户进行编辑、改进或验证。

相比之下,大语言模型的神经网络参数是不可解释的;至少,不可能以任何有意义的方式解释单个参数值。因此,虽然大语言模型能够“理解”文本以生成文本的内部语义表示,但该表示本身没有意义,因此不能以任何有意义的方式展示给人类用户,人类也无法与该表示进行交互以编辑、改进或验证它。

然而,传统语言模型的可解释性是以其有限的表达能力为代价的。实际上,由于数据稀疏,如果 n 很大,我们无法准确估计 n - gram 语言模型。因此,我们倾向于使用非常低阶的 n - gram 语言模型。实际上,在信息检索中,一元语言模型经常被使用,高阶 n - gram 语言模型并没有比一元语言模型表现出明显的优势,这可能是由于高阶模型的估计不准确。相比之下,大语言模型寻求单词的潜在向量表示(嵌入向量),以便该潜在表示可用于预测传统语言模型中的参数值,从而产生更具泛化能力的语言模型。

例如,考虑一个二元模型,其中和是两个单词。对于传统语言模型,我们至少需要在训练数据中观察词汇表中所有单词的成对组合才能估计这样的模型;实际上,为了准确估计所有这些概率,我们需要多次观察每个组合的出现。然而,根据齐普夫定律,在任何自然生成的文本数据中,这通常不会发生,因为大多数单词很少出现,更不用说两个单词的组合了。

神经网络语言模型通过尝试基于它们的嵌入向量表示对两个单词和之间的关系进行建模来打破这一限制。也就是说,我们不再像在传统语言模型中那样将单词视为“黑箱”。事实证明,这非常强大,因为即使我们在数据中没有观察到的组合,它也能使我们推断出的概率。其背后的直觉是,它可以使用单词和的一般上下文来推断跟随的可能性。例如,如果是的同义词,它们将出现在相似的上下文中,因此它们的嵌入向量表示将相似。因此,即使我们没有观察到,只要我们观察到,我们仍然可以基于推断出。

需要注意的是,这种推断在传统语言模型中必须使用平滑方法以特别的方式进行,但在大语言模型中可以通过在深度神经网络中学习多层隐藏表示自然地实现,在深度神经网络中,相似的上下文被映射到相似的潜在表示,从而在基于上下文预测单词时能够进行外推。

比较表明,从语言建模的角度来看,大语言模型通常比传统语言模型强大得多。多层潜在向量表示自然地执行了传统语言模型中所有需要的平滑操作。潜在表示可以被视为大语言模型对文本数据语义的某种程度的理解,这也解释了为什么它们在许多任务上表现如此出色。然而,与传统语言模型相比,大语言模型的主要限制是它们的参数不可解释,这使得很难通过人类反馈直接改进它们,用户也无法检查这些参数以获得对要分析内容的任何理解。

大语言模型和传统语言模型的另一个区别是,大语言模型通常使用大量数据进行训练,不仅包括自然语言文本,还包括其他半结构化数据,如软件代码和表格。大型多模态语言模型甚至可以使用包括文本和图像的多模态数据进行训练。此外,许多机器学习技术可以应用于改进大语言模型,包括自监督(无监督)学习、监督学习(微调)、指令调整、从人类反馈中进行强化学习(RLHF)和上下文学习。

因此,单个基础大语言模型可以通过指令/训练来执行多个任务,特别是包括使用自然语言与用户进行对话,从而直接实现问答和对话式信息检索。

大语言模型提供的一般机会包括以下几点:

  • 对话式用户 - 系统交互:能够理解自然语言使任何系统都能实现对话式用户 - 系统交互。具体而言,大语言模型能够理解用户的自然语言指令,因此用户可以潜在地使用自然语言句子(例如聊天)与任何系统进行交互,然后这些句子可以转换为系统能够理解的明确定义的指令。

  • 文本生成和对话:能够生成流畅的自然语言使许多原本不可行的文本生成任务成为可能。作为一个具体示例,大语言模型可以进行自然语言对话。

  • 学习执行新任务:微调(通过指令)进一步扩大了应用范围,因为我们可以潜在地对我们感兴趣的任何任务进行微调。代码训练通常可以进一步增强它们的能力。

值得注意的是,随着我们进一步对基础大语言模型进行微调与训练,它将越来越像一个智能体,可以自主完成任务(例如回答用户的问题)。然而,作为一个智能体,大语言模型存在产生幻觉的可能性,即生成不真实的文本。这可以被视为神经网络语言模型在基于学习到的上下文表示进行泛化时不可避免的代价,即幻觉是“过度泛化”的一种症状。需要注意的是,过度泛化有时是有益的(例如,当要求大语言模型写诗时),但在许多其他情况下,如为用户提供信息和知识时,幻觉将不可避免地损害其可信度。更糟糕的是,大语言模型无法真正解释生成特定文本背后的推理过程,这使得解决幻觉问题更加困难,极大地限制了它们的效用,特别是在医疗信息等可靠性至关重要的高风险应用中。

从信息检索的角度来看,大语言模型的另一个主要限制是它们无法获取最新信息。例如,它不知道今天的天气或五分钟前发布的任何新闻文章。虽然从理论上讲,大语言模型可以频繁更新以解决这个问题,但在实践中,通常这样做是不可行的,因此仅靠它们不足以服务用户,仍然需要搜索引擎或数据库系统来支持对实时信息的访问。

2.2 当前搜索引擎的改进

尽管当前的搜索引擎缺乏对自然语言的理解,但它们已经非常有用,并且每天被许多用户使用。搜索引擎行业的成功在很大程度上与人工智能 - 人类协作的优化有关;实际上,作为一种辅助人工智能系统,搜索引擎通过帮助用户从大量文档(如网络)中找到相关文档(信息)为用户提供了明确的价值。搜索引擎可以增强用户的智能,因为能够使用搜索引擎的用户比无法使用搜索引擎的用户能够做出更好的决策(前者看起来更聪明)。

大多数搜索引擎用户已经适应了搜索引擎的智能水平,以便有效地与搜索引擎协作。因此,尽管搜索引擎只能响应关键词查询,而不能像 ChatGPT 那样回答问题,但用户已经习惯输入关键词查询并重新表述他们的查询。当然,如果一个系统能够直接(且可靠地)回答用户的问题,用户会更喜欢这样的问答系统而不是搜索引擎。实际上,当用户最初使用搜索引擎时,他们可能倾向于输入问题而不是关键词查询,但在意识到搜索引擎并不真正理解问题并将问题视为一组关键词后,用户会通过仅使用关键词查询来适应搜索引擎。

当用户的查询是一个热门查询并且搜索引擎已经从先前用户那里收到了关于该查询的一些反馈时,搜索引擎通常会工作得很好,用户通常对这种基于查询的交互感到满意。用户不满意的情况是,即使用户多次重新表述查询,搜索引擎也无法令人满意地回答他们的查询。这种“困难”的查询通常是长尾查询,这意味着没有多少用户有这种信息需求。有许多这样有点独特的查询,并且它们通常遵循长尾分布。

这种情况发生的一个常见原因是用户存在词汇差距,即用户对相关内容不太了解,因此无法预测相关文档中会使用什么样的单词。不幸的是,这种情况很常见,因为当用户需要某些信息时,通常是因为他们对该主题不太熟悉(否则,他们一开始就不需要搜索)。具体示例包括医疗搜索或需要具有复杂规格产品的电子商务搜索。

不明确/模糊的信息需求(例如购买礼物)也可能给搜索引擎有效服务用户带来挑战。在这种情况下,用户将受益于接收多样化的搜索结果和学习每个选项的支持,以便将模糊的信息需求细化为更具体的需求。

当前的搜索引擎在以下方面也存在限制:它们无法准确理解用户的意图。它们无法帮助用户消化搜索结果。它们仅支持有限的交互(用户表达信息需求的方式有限)。

通过利用大语言模型可以潜在地解决上述所有限制:1)大语言模型能够很好地理解自然语言,因此可以通过建议在查询中使用的替代单词或促进语义相关的不同单词的匹配(即支持语义匹配)轻松弥补词汇差距。2)大语言模型可用于澄清用户的意图或帮助用户澄清/细化意图(例如,通过与用户进行对话)。3)可以提示大语言模型从适合用户的任何角度总结搜索结果。4)可以利用大语言模型支持对话式搜索,从而使用户能够更准确、更全面地表达信息需求。

2.3 用于下一代搜索引擎的大语言模型

凭借大语言模型的对话能力和直接回答问题的能力,下一代搜索引擎有可能通过以对话方式同时支持问答和搜索,为用户提供更有效的信息服务。

问答通常是满足用户信息需求的最有效方式,大语言模型可以基于训练数据中的信息正确且简洁地回答许多问题。然而,由于存在幻觉问题,用户通常希望看到支持答案的原始信息源。除非大语言模型能够记住所有来源,否则我们可能需要搜索引擎来查找支持答案的来源。这意味着大语言模型需要学习如何使用搜索引擎,否则用户将不得不进行搜索以验证答案。因此,即使我们使大语言模型成为通过问答与用户交互的主要智能体,它仍然需要与搜索引擎协作。

在其他情况下,用户可能主要想使用搜索引擎。例如,当用户的信息需求是探索性的时,使用搜索引擎可能更好地满足用户的需求。在这种情况下,大语言模型可以通过多种方式增强搜索引擎,包括与用户进行对话以澄清信息需求。

因此,一般来说,下一代搜索引擎可能会将问答与搜索集成,并支持对话式搜索。传统的检索模型实际上都是基于概率排名原则设计的,因此都支持文档排名。随着我们迈向对话式搜索时代,我们需要一种新的检索模型,能够实现用户信息需求的对话式澄清。这样的检索模型需要是可解释的,以便用户能够参与到澄清信息需求和优化文档排名的循环中。我们将在本文后面提出一个可解释和可解释的概率匹配模型来实现这一目的。

3. 改进当前搜索引擎

已经有很多关于使用大语言模型改进当前搜索引擎的工作。该调查对现有工作进行了出色的回顾。虽然现有工作的结果总体上是积极的,但它们不一定能产生大语言模型可能带来的最大影响。下面我们提供一个略有不同的框架来讨论使用大语言模型改进当前搜索引擎的一些最佳机会,预计大语言模型将对提高搜索引擎的效用产生重大影响。

我们的观点基于理想查询假设,该假设指出对于任何给定的信息需求,存在一个完美的查询,该查询将使检索系统能够将所有相关文档排在不相关文档之上。虽然这样的完美查询实际上可能不存在,但通常可以通过仅使用一个高效查询来唯一地识别相关文档,该查询包含在目标(相关)文档中一起出现但在其他文档中不出现的几个术语。这样的查询将使用户能够在搜索结果的顶部看到至少一个相关文档。从这里,用户可以提供反馈或额外的查询以根据需要检索其他相关文档。

理想查询假设的一个重要含义是,如果系统能够帮助用户构建理想查询,基于关键词的搜索引擎(即具有基本检索功能如 BM25 的当前搜索引擎)可能会非常有效,并且用户可能会对这样的搜索引擎感到满意;搜索系统也将非常高效,因为它可以利用倒排索引来高效地进行搜索。因此,大语言模型改进当前搜索引擎的最佳机会之一是用于帮助用户构建理想查询,特别是因为大语言模型可以被认为几乎没有词汇差距,因此能够制定有效的查询。

基于此观点,我们现在简要讨论大语言模型如何解决当前搜索引擎的多个限制。

3.1 大语言模型弥补词汇差距

一般来说,词汇差距可以通过三种方式弥补:1)扩展查询以包括能够与相关文档中的术语匹配的术语;2)扩展文档以包括可能在与该文档相关的查询中使用的术语;3)保持查询和文档不变,但允许语义相关的不同单词进行匹配。这三种策略是互补的,因此可以潜在地结合使用。

大语言模型可以直接用于(通过提示或微调)执行查询扩展和文档扩展。这将直接利用大语言模型的文本生成能力。语义匹配可以通过微调大语言模型以评估文档与查询的相关性来实现。一般思路与许多神经排名模型类似,在这些模型中,查询和文档都会被映射到嵌入向量,然后可以计算它们的相似度来评估相关性。

3.2 大语言模型用于明确用户意图

当用户的意图不明确(例如,一个有歧义的查询词)时,返回的顶部结果可能包含与不同意图匹配的结果(例如,该歧义词的不同含义)。在这种情况下,大语言模型可用于根据排名靠前的结果生成关于用户查询的澄清问题。例如,可以要求大语言模型分析顶部结果以识别一个单词的多种含义,并生成诸如“你说的 jaguar 是指动物还是汽车?”这样的问题。大语言模型还可用于解释用户的答案并改进查询表述。

当用户由于缺乏知识而意图模糊时,大语言模型可以在搜索时向用户传授相关知识以完善查询。例如,可以向用户提供一个描述为“了解更多关于 X”的链接,点击该链接将触发用户与大语言模型的对话。一般来说,大语言模型在搜索会话期间支持用户学习非常有用。

3.3 大语言模型用于搜索结果总结

与其让用户与当前无结构的搜索结果集合进行交互,不如使用大语言模型根据用户的查询直接总结搜索结果(即面向查询的总结)。大语言模型还可以在搜索结果的背景下支持问答,使用户能够灵活地消化搜索结果并获取相关信息。如果搜索结果被总结,该总结自然可以作为与用户对话的起点,允许用户提出额外的问题并参与对话。

一般来说,大语言模型可以在搜索过程中帮助用户学习,从而通过提高人类智能来优化人机协作。一旦用户获得足够的知识,他们就能够制定有效的查询,这将使当前的搜索引擎(即使没有改进)能够为用户提供满意的结果。

3.4 大语言模型用于对话式反馈

从人机协作的角度来看,尽可能利用人类智能是有意义的,对于信息检索来说,这意味着要让用户自然地提供反馈并解释为什么他们对当前的搜索结果不满意。例如,可以允许用户解释为什么他们喜欢或不喜欢某个文档,并使用示例文档详细说明信息需求。可以利用大语言模型使用户能够提供对话式反馈。例如,可以允许用户说“喜欢这个文档因为它是关于 X 的”,其中 X 是一个主题描述,并且大语言模型可以根据此反馈相应地重新制定查询。一般来说,有了大语言模型,用户将能够使用复杂的自然语言句子表达信息需求,并在特定的搜索上下文中提供反馈,在该上下文中可以参考特定的搜索结果以提供详细的反馈。

3.5 总结

总之,大语言模型可以自然地用于显著增强当前的搜索引擎,使用户能够使用可能复杂的自然语言句子表达信息需求,并与他们协作以交互方式制定有效的(理想的)查询,然后可以使用常规搜索引擎执行该查询,为用户生成满意的结果,而不会增加搜索的复杂性。它们还可用于通过对搜索结果进行自适应总结来帮助用户有效地消化相关信息,并通过回答他们的问题来增强用户的知识。最后,它们可用于在上下文中理解用户的反馈,从而改进查询重新制定。所有这些改进都可以映射到[2]中提出的一般人机 - 信息检索 - 大语言模型交互框架中,作为实现交互的具体方式。

然而,虽然大语言模型的这些应用将导致与用户的更多交互,甚至包括自然语言对话,但它们无法有效解决搜索中的关键挑战,即详细和准确地建模相关性;实际上,如果没有一个可解释和可解释的模型来详细建模相关性,系统和用户之间的对话可能不会迅速导致用户的信息需求与集合中的文档准确匹配。为了实现这一点,对话必须围绕一个更详细的相关性模型进行。这可以通过为信息检索开发一个通用的可解释和可解释的匹配模型来实现,我们将在下一节中讨论。由于基于这样一个新模型构建的系统可能与当前的搜索引擎有很大不同,我们将其视为下一代搜索引擎,我们将在下一节中详细讨论。

4. 下一代搜索引擎

在信息检索应用中,最重要和最困难的挑战是当用户无法制定有效的查询时如何为用户服务。在这种情况下,我们需要详细了解用户到底在寻找什么。关键问题是:对于这个用户来说,相关性的准确标准是什么?如何利用与用户的对话或交互自然地澄清相关性标准是一个关键的技术挑战,因为这需要以某种方式形式化相关性。我们提出了一个可解释的概率匹配模型,用于基于对信息需求和信息项(文档)的多个属性进行建模来形式化相关性。将相关性匹配分解为属性匹配可以实现关于搜索结果的更详细的属性级反馈,这可以用于直接改进相关性匹配并支持用户意图的对话式澄清。

4.1 可解释的概率检索模型

所提出的模型如图 1 所示。形式上,我们将问题定义为确定来自源 S 的信息项 I 与来自用户 U 的查询 Q 在上下文 c 中是否匹配,其中上下文 c 可能包括许多可能影响搜索的环境因素,如搜索的时间或位置。也就是说,我们想要估计概率。我们有意使用“Match”而不是“Relevance”这个词来强调匹配标准的多个维度,并避免将主题相关性作为主要检索标准的典型(狭义)解释。在功能上,然而,我们可以基于匹配概率以与相关性概率相同的方式对项目进行排名。我们还表明,类似的用户和类似的项目都可以潜在地用于改进匹配概率的估计,尽管我们在本文中不会探讨这一点。

如果我们不进一步分解而直接估计这样的概率,我们可以对项目进行排名,但无法支持与用户的任何有意义的对话以澄清意图或获得详细反馈。因此,我们的想法是将项目与查询的匹配分解为它们各自多个属性的匹配。

首先,我们假设一个项目可以由多个属性表征,并且来自源 S 的项目 I 的属性值由一组概率表征,其中。例如,如果项目是一个产品,可以是价格或重量,可以表示特定项目 I 的实际价格或重量(我们使用概率是因为并非所有属性值都是已知的,因此存在不确定性)。同样,如果项目是一篇新闻文章,可以是文章的主题类别或日期,可能表示特定文章 I 的实际主题或日期。

类似地,我们假设用户 U 的信息需求 N 也由多个属性表征,并且首选属性值由一组概率建模。一般来说,属性和是不同的(因此导致词汇差距),尽管它们也可能重叠。例如,如果查询是关于寻找一台笔记本电脑,可以是首选价格或重量(这可能与重叠),但也可以是“笔记本电脑是否适合旅行”(这不太可能直接与任何匹配)。需要注意的是,信息需求 N 是未观察到的,并且给定 N,首选属性值假定不依赖于 Q、U 或 c,因此 N 完全表征了用户在上下文 c 中通过查询 Q 表达的信息需求。在这个假设下,我们还需要基于查询推断信息需求,即估计。

基于这样一个用于信息需求和项目表示的基于属性的模型,我们现在可以在属性级别定义匹配如下:

第一个方程捕捉了与查询匹配意味着与查询所表达的信息需求匹配的直觉,并考虑了关于信息需求 N 的不确定性。第二个方程进一步将项目与信息需求的匹配定义为它们各自属性的匹配。通过这种分解,我们看到整个检索模型基于以下具体模型:

  1. 需求推断模型(NIM):捕捉了在用户 U 在上下文 c 中提出查询 Q 的情况下信息需求为 N 的可能性。

  2. 需求属性模型(NAM):基于首选属性值详细表示信息需求。

  3. 项目属性模型(IAM):基于项目 I 的(推断)属性值详细表示项目。

  4. 属性匹配模型(AMM):建模项目的属性 B 与信息需求的属性 A 匹配(即满足)的可能性。

这个模型的一个主要优点是它可以为为什么为用户检索某个项目提供有意义的解释。假设所有属性和都是可解释的,我们将能够通过识别对匹配概率贡献最大的匹配属性来解释为什么检索某个项目(例如,这个项目的属性(例如笔记本电脑的重量)与你的信息需求的属性(例如“适合旅行的笔记本电脑”)相匹配)。

此外,有了这样的可解释解释,用户可以通过明确提供关于或的反馈来澄清对其意图的任何误解,从而实现有意义的对话,这可以导致组件模型的改进,从而改进整体搜索结果。

从理论上讲,如果我们能够准确估计所有这些组件模型,我们将能够完美地将项目与用户的信息需求进行匹配。然而,在现实中,准确估计所有这些模型仍然相当具有挑战性。但是,大语言模型可以被利用来估计所有这些模型。

4.2 大语言模型用于模型估计

4.2.1 需求推断模型(NIM):

对 NIM 的估计首先需要我们定义一个用户信息需求的本体。这可以是,例如,产品目录或任何其他有意义的分类法。可以提示大语言模型提前创建这样的信息本体。例如,一个大语言模型可能会建议不同类型的产品,这可能比电子商务搜索引擎中维护的产品类型更精细。

接下来,给定查询,可提示大语言模型直接建议用户可能的意图/需求。

4.2.2 需求属性模型(NAM):

属性通常可以从查询背后推断出的需求 N 中获得。例如,如果查询是关于一个产品的,推断出的产品类型(例如笔记本电脑)可能直接建议属性,如重量、屏幕尺寸和价格,要么基于产品集合中的属性信息,要么通过使用大语言模型。

可以很容易地提示大语言模型建议属性的首选值。我们在图 2 中展示了一个提示 ChatGPT 估计查询“用于旅行的笔记本电脑”的“屏幕尺寸”属性的示例。ChatGPT 的结果包括多个尺寸以及每个尺寸的解释:13.3 英寸、14 英寸、11 - 12 英寸、15 英寸或更大。

这里有一些有趣的观察结果:首先,原始查询存在词汇差距,因为笔记本电脑的描述(规格)不太可能与“旅行”这样的词匹配,但 ChatGPT 可以通过推断首选属性值来弥补这个词汇差距,在这种情况下,这些属性值与项目属性重叠,因此可以直接与项目属性匹配。其次,首选属性值的不确定性为对话式澄清用户意图提供了基础。这也表明结果应该多样化,并利用用户的反馈进一步澄清意图。

4.2.3 项目属性模型(IAM):

IAM 通常可以基于项目 I 的文本描述进行推断。例如,产品规格可以用于提取特定的属性值。对于新闻文章,可以使用信息提取或文本分析来提取有趣的属性值,如主要主题或日期。在所有这些情况下,大语言模型都可以被利用来增强现有的方法或直接为项目生成属性值。因此,大语言模型也可以用于填充缺失值或用可能更好地反映用户视角的额外属性扩充属性集(例如,对于重量较轻的笔记本电脑,可以添加“适合旅行”)。

4.2.4 属性匹配模型(AMM):

一旦属性 A 和 B 被明确定义,通常可以提示大语言模型提供 A 是否与 B 匹配的估计以及解释。例如,考虑一个关于具有两个属性值的笔记本电脑的查询/需求:(重量 =“轻”;使用 =“旅行”)和一些特定的笔记本电脑产品。我们提示 ChatGPT 估计这些属性的匹配情况。结果表明 ChatGPT 确实可以提供一个非常有意义的估计和解释。

具体来说,在图 3 中,我们看到 ChatGPT 非常确定地说存在匹配,即,而在图 4 中,当估计时,它就不太确定了。有趣的是,它给出了关于为什么不确定的具体解释,这为生成澄清问题询问用户偏好提供了有用的背景,从而支持对话式搜索/反馈。在图 5 中,我们看到 ChatGPT 可以利用其知识准确地估计,这里存在较大的词汇差距,因此需要额外的知识来进行匹配估计。再次,ChatGPT 可以被利用来与用户互动,进一步澄清他们的需求。这种通过将匹配分解为属性级别的匹配来实现的意图的对话式澄清,对于有效帮助查询效果不佳的用户是必要的。

如图 6 所示,所提出的概率模型也可以有效地实现为一个完全可解释的神经网络模型。这样一个可解释的匹配神经网络(MNN)将在底部接收用户 U、上下文 c 和查询 Q 作为输入,并尝试在顶部预测(生成)一个项目 I 作为输出。与普通神经网络不同,MNN 中的节点和边都是可解释的。如果我们使用这样的 MNN 从底部向上传递信息,我们将能够获得每个相对于 U、Q、I 和 c 的得分,等同于我们的概率模型,即得分将等同于(在 MNN 图示中我们省略了源 S)。这意味着我们可以以类似于训练神经网络的方式端到端地训练所提出的概率模型,使用搜索日志数据作为训练数据。

4.3 可解释的神经网络匹配模型

然而,这种训练的一个问题是数据可能是稀疏的,因此我们会遇到与传统语言模型相同的问题。为了解决这个问题,有两种策略。一种是利用大语言模型来估计或改进所有组件模型的估计,正如我们已经讨论过的,因此不一定或不仅仅依赖于搜索日志数据。另一种是将 MNN 用作神经网络的“骨干”,并通过用可能的一组神经元替换每个节点和用一个子神经网络替换每个边来扩展它(即,连接 X 到 Y 的边可以用一个以 X 为输入、Y 为输出的子神经网络替换)。这样,我们将拥有一个比普通神经网络具有更好可解释性的有趣神经网络,同时也能够利用深度神经网络的表示学习能力(它可能与神经符号架构有关)。

5. 作为搜索引擎用户的大语言模型:迈向智能体

可以合理地预期,随着更多的数据和人类用户/任务被用于训练大语言模型,以及可能开发出更新的类似人类大脑的架构来提高它们的推理能力,大语言模型将变得更加强大。从长远来看,这将如何影响信息检索研究和应用?未来的信息检索系统会是什么样子?大语言模型最终会完全取代信息检索系统吗?在本节中,我们试图通过对未来信息检索系统的愿景来回答这些问题,我们认为未来的信息检索系统将是个性化任务智能体,将利用搜索引擎以及大语言模型作为支持技术来帮助用户完成任务。

在图 7 中,我们展示了这个愿景。在 X 轴上,我们展示了当前一代的大语言模型大多是不可解释的,但在未来,我们可能会看到更多具有类似人类神经符号架构的可解释大语言模型,最终,我们可能会有更多自主的大语言模型,它们不需要人类设计它们的奖励(目标)函数,因为它们可以潜在地从与用户和任务环境的交互中学习这些函数。基于这个愿景,可以合理地预期信息检索系统也会相应地发展,我们在 Y 轴上展示了这一点。

具体来说,由于当前的大语言模型是不可解释的,它们的可信度会限制它们直接服务用户的效用(例如,幻觉问题),因此一般来说,使用当前大语言模型的一个好策略是将它们作为现有系统(如搜索引擎)的组件或支持技术(因此大语言模型“低于”现有技术)。随着大语言模型变得可解释且更可信,我们可以预期大语言模型将更直接地服务用户。在那时,现有的信息检索技术可能会成为大语言模型的支持技术(因此大语言模型“高于”现有技术)。然而,它们的集成可能会比较松散,人类将不得不设计一个框架让它们进行交互,因为大语言模型不是自主的。最后,随着我们有更多自主的大语言模型,它们可能会自动学习如何使用现有的工具,如搜索引擎或任何其他工具,因此我们可能会有由大语言模型驱动的自主智能体,能够“吸收”任务环境中的所有技术,包括搜索引擎、数据库系统和其他工具。

从表面上看,这种分析可能似乎表明信息检索系统(搜索引擎)最终将被大语言模型取代。然而,事实并非如此。我们提出的是,信息检索系统将演变为更自主和更智能的任务智能体,能够代表用户使用搜索引擎。

实际上,我们认为大语言模型不太可能取代搜索引擎。这是因为它们通常无法轻松获取最新的可用信息,除非它们能够使用搜索引擎。例如,ChatGPT 无法回答关于今天发生的任何事件的问题,仅仅是因为它没有被训练/提供这样的信息。虽然从理论上讲,ChatGPT 有可能每分钟都进行更新,但在实践中这是不可行的。鉴于此限制,让 ChatGPT 为用户提供最新信息的唯一方法是让它使用搜索引擎。因此,搜索引擎总是必要的。然而,在未来,用户可能会与大语言模型(更准确地说,是由大语言模型驱动的智能体)进行交互,然后智能体会根据需要代表用户使用搜索引擎。

由于未来的大语言模型将在假设搜索引擎可用的环境中使用,它们需要接受与当前不同的目标训练,以便避免“浪费”参数来记忆可以通过使用搜索引擎轻松检索的数据或信息,并鼓励它们使用参数来学习搜索引擎无法轻易提供的更复杂的知识/信息。

这种情况类似于闭卷考试与开卷考试。当我们使用当前的大语言模型解决问题时,这类似于闭卷考试,因为模型必须在不参考任何外部来源的情况下解决问题。然而,为了向用户提供最新信息,这些大语言模型必须采用开卷模式,即在帮助用户完成任务时实时调用搜索引擎。一般来说,未来的智能任务智能体需要学习如何有效地使用各种工具,特别是搜索引擎。就像学生在准备开卷考试时不会死记硬背数据(因为他们可以根据需要查看数据)一样,未来的大语言模型也需要更智能地进行训练,不要浪费参数来记忆通过使用搜索引擎在运行时可以轻松获得的数据和信息。这可以通过最小化混合系统的误差来实现,在混合系统中,大语言模型将与其他工具(如搜索引擎)结合使用,以协作最小化损失函数;例如,智能体可以使用强化学习来学习何时使用搜索引擎或其他工具的策略。

从信息检索研究的角度来看,我们需要应对与构建服务于人工智能智能体用户而非人类用户的搜索引擎相关的特殊挑战(例如,关于人类用户的顺序浏览假设对人工智能用户可能不成立)。此外,由大语言模型驱动的人工智能智能体通常比人类用户的词汇差距小得多,因此可以预期它们能够制定有效的关键词查询,这意味着对于搜索引擎来说,可能只支持关键词搜索就足够了,并且考虑到其计算复杂性,复杂的排名算法(包括神经排名算法)可能变得不那么关键甚至不必要。

6. 总结与未来研究

在本文中,我们探讨了关于如何将大语言模型应用于信息检索以及它们将如何长期影响信息检索研究和应用的各种问题。我们提出了多种利用大语言模型改进当前一代搜索引擎的方法,并提出了一个可解释的概率检索模型,以实现下一代搜索引擎中的对话式搜索,该模型可以实现为一个可解释的神经网络。最后,我们认为搜索引擎不会被大语言模型取代,但未来的大语言模型在服务用户时需要实时学习如何使用搜索引擎。

我们在论文结尾列出了一系列未来研究的有趣问题:

  • 1)我们如何利用大语言模型弥补词汇差距?如何利用大语言模型有效且高效地支持查询重写和文档扩展/标注?

  • 2)我们如何利用大语言模型以交互方式总结搜索结果(例如,生成可导航的总结)?

  • 3)我们如何利用大语言模型对查询意图和用户任务进行交互式澄清?

  • 4)我们如何使用搜索日志数据微调大语言模型以有效学习相关性表示(基于相关性进行推理)?如何系统地利用大语言模型估计所提出的可解释概率模型中的组件模型?

  • 5)我们如何利用大语言模型支持带有知识来源的问答?

  • 6)我们如何支持带有最新信息和知识的问答?

  • 7)我们如何支持无幻觉的问答或支持对答案的交互验证?

  • 8)我们如何使用大语言模型构建用于评估和训练交互任务智能体的真实用户模拟器?

  • 9)我们如何使用大语言模型对用户任务进行建模?

  • 10)我们如何使用大语言模型构建能够随着时间从任务环境中持续学习(例如,提高其使用搜索引擎的技能)的个性化对话任务智能体?这些方向上的未来研究进展将使大语言模型能够有效地用于改进当前搜索引擎和开发下一代搜索引擎。


作者:张长旺,图源:旺知识

参考资料

  • 标题:Large Language Models and Future of Information Retrieval: Opportunities and Challenges

  • 作者:ChengXiang Zhai

  • 单位:University of Illinois at Urbana-Champaign

  • 标签:大语言模型、信息检索、搜索引擎、智能体

  • 概述: 本文探讨了大语言模型在信息检索中的应用,分析其机遇与挑战,认为大语言模型不能取代搜索引擎,还提出了改进当前搜索引擎和构建下一代搜索引擎的方法及未来研究方向。

  • 链接:https://dl.acm.org/doi/pdf/10.1145/3626772.3657848

举报/反馈
分享到: 微博 QQ 空间
对本文内容有合作意向?
我们将在 1 个工作日内与您联系
留言咨询