本章介绍了研究所选文献数据的获取来源和途径。通过&nn 爬取的方式获取大部分文献数
据与元数据,对元数据进行基本处理,为后续分析提供帮助,丰富向量知识库的数据储备。随后为
了最大程度提高向量知识库的可信程度,对文献数据进行筛选,选出带有流程图,数据,输入输出
的英文文献,作为最后使用的数据。精细筛选后,使用 Unstructured 库进行数据预处理使其转化
为结构化数据。
4.2 向量知识库的构建
向量知识库构建是一个将处理过的数据嵌入向量知识库的过程,主要用于将不同类型的数据转
化为向量,并进行存储和检索。其流程如图 4.1 所示。
图 4.1 向量知识库构建流程
对收集到的数据进行清洗、去重、分类,提取分割文本,以确保数据的质量和有效性。消除噪
声数据,提高数据的一致性和准确性。将预处理后的数据转化为向量,将向量化后的数据存储到向
量知识库中,并利用向量数据库进行高效的存储和检索。向量数据库是一种专门用于存储和检索向
量数据的数据库系统,可以根据语义或上下文含义查找最相似或相关的数据。
测试流程包括以下几个步骤:
测试设计:根据目标领域定义测试用例,包括典型问题、边缘情况和错误输入。
环境搭建:搭建测试环境,包括聊天界面和后端模型处理系统。
执行测试:记录模型的回应。
评估结果:根据预设的标准(如准确性、响应时间、用户满意度)评估模型表现。
优化模型:根据测试结果对模型进行调整和优化。
5.2 智能交互组件&nt 技术来进行智能对话交流。Chatt 通常被用于客户服务、信息查询、娱乐等各种场景,可以通过
文本或语音与用户进行交互。 人力成本和时间消耗。
体验。
为用户提供多样化的对话途径。
本项目选择 OpenAI 的 GPT 模型作为&nt 的大语言模型基座,GPT 模型基于&nrmer
架构,相较于其他模型,这种架构允许模型在处理长文本时保持较好的性能,同时具有良好的并行
化能力,使得模型的训练和推理速度得到提升。
5.2.1&nt 后端
基于先前构建的针对电力 LCA 领域的向量知识库构建&nt 测试模型性能,主要设计思路是
为了实现检索功能,大致可分为知识库检索功能和在线搜索。 用户通过&nt 界面输入他们的问题或请求。对用户输入文本进行清洗,包括去除标点符
号,进行分词等。转化为结构化数据后将预处理后的文本转换为向量形式,以便于机器理解。将向
量化