阿里云国际站代理商:人工智能平台 PAI-在 PAI-EAS 部署大模型RAG对话系统
适用范围
本文适用于RAG版本0.4.x。旧版本参见PAI-RAG(v0.3.x)。
步骤一:部署RAG服务
-
登录PAI控制台,在页面上方选择目标地域,并在右侧选择目标工作空间,然后单击进入EAS。
-
在推理服务页签,单击部署服务,然后在场景化模型部署区域,单击大模型RAG对话系统部署。
-
在部署大模型RAG对话系统页面,配置如下关键参数:
-
版本选择:选择LLM分离式部署,仅部署RAG服务。
LLM一体化部署将RAG服务与大语言模型部署在同一个EAS服务实例中。由于大模型需要较高资源规格,建议仅在使用小模型时选择此模式。
-
RAG版本:
pai-rag:0.4.3。 -
资源信息:
-
资源类型:选择公共资源。
-
部署资源:RAG服务本身资源消耗较低。建议选择至少8核CPU和16 GB内存的规格,例如
ecs.c7.2xlarge或ecs.c7.4xlarge。
-
-
向量检索库设置:
-
版本类型:选择FAISS(构建本地向量库以便快速实践)。生产环境建议使用其他成熟的向量检索库,配置方式请参见使用阿里云向量数据库。
-
OSS地址:选择当前地域下已创建的OSS存储目录,用来存储上传的知识库文件。如果没有可选的存储路径,您可以参考控制台快速入门进行创建。
-
-
专有网络:下文将需通过公网访问阿里云百炼的模型服务。请在此处配置VPC,开通公网NAT网关并配置SNAT条目,详情请参见让EAS服务访问公网。
-
-
参数配置完成后,单击部署。服务部署时长通常约为5分钟,当服务状态变为运行中时,表示服务部署成功。
步骤二:快速体验知识库问答
在推理服务页签找到已部署的RAG服务,进入服务详情页,单击右上角的Web应用,进入WebUI页面。

2.1 配置大语言模型
单击左下角设置 > 模型,进入模型配置。这里以配置百炼qwen3-8b模型为例。更多模型配置说明参见配置模型。
-
阿里云百炼模型调用需单独计费,请参见阿里云百炼计费项说明。
-
调用百炼模型需为RAG服务配置有公网访问能力的专有网络。
-
模型ID:对话时用于选择不同的模型。这里填写Qwen3-8B_bailian。
-
Endpoint URL:填写模型服务地址。阿里云百炼北京地域模型服务地址为 https://dashscope.aliyuncs.com/compatible-mode/v1。
必须以
/v1、/v2形式结尾,如为EAS服务,请在服务调用地址后添加/v1。 -
API Key:参见获取API Key。
-
模型名称:填写qwen3-8b。

2.2 添加知识库
系统已默认配置Embedding模型,可以直接创建知识库并上传文档。
-
创建知识库。单击左侧知识库,进入知识库页面,选择新建知识库。
以创建一个iPhone16技术规格介绍的知识库为例,设置知识库名称为iPhone16,其他参数保持默认。
-
上传文件。在文件管理页签,单击上传文件。文件上传成功后,单击开始解析。示例文件:iPhone 16 和 iPhone 16 Plus – 技术规格 – Apple (中国大陆).pdf。

-
查看知识库文件。上传成功后,可单击文件名,查看文档切片。
-
检索测试。切换到检索测试页签,输入查询内容(如
iPhone16),测试知识库检索。
2.3 知识库问答
-
单击左侧新建对话,在对话页面上方选择模型,下方单击知识库,选择要使用的知识库(如iphone16介绍)单击激活,然后保存。
建议先对话测试模型配置成功,再激活知识库。

-
在对话框内输入问题。

步骤三:更多问答模式体验
多模态问答(图文对话)
多模态问答需要配置OSS存储环境变量(用于存储上传的文件和图片),并使用多模态模型。
-
为RAG服务配置OSS存储环境变量。场景化部署不支持直接设置环境变量,在部署服务页面右上角选择切换为自定义部署(已创建的服务可通过更新操作进入部署页面),在环境信息区域增加如下环境变量:
-
FILE_STORE_TYPE:设置为oss。
-
OSS_BUCKET:填写OSS BUCKET名称。
FILE_STORE_TYPE设置为oss后,OSS_BUCKET下会自动生成
pairag_knowledgebases目录,用于存储知识库文件和对话附件。不设置FILE_STORE_TYPE时,默认存储在挂载的OSS目录下。 -
OSS_ENDPOINT:OSS访问地址,请参见OSS地域和Endpoint。如
oss-cn-hangzhou.aliyuncs.com。 -
OSS_ACCESS_KEY_ID、OSS_ACCESS_KEY_SECRET:拥有AliyunOSSFullAccess权限的AK和SK。
-
-
配置多模态大语言模型(如Qwen-VL系列)。以qwen3-vl-plus为例,配置如下,需打开多模态模型开关。

-
对话示例。

Agentic问答(MCP工具调用)
此模式利用模型的思考和工具调用能力(如搜索、地图)来回答复杂问题。
使用示例如下:
-
配置支持思考的模型。模型配置中思考模型选项配置为打开。

-
配置搜索。
-
选择搜索引擎:Tavily搜索。
中文搜索还可配置阿里云通用搜索。
-
Tavily API Key:访问 Tavily 官网注册账户,并获取API Key。

-
-
配置高德MCP。单击左下角设置 > MCP,参数配置如下。
-
MCP 名称:amaps
-
MCP 链接:https://mcp-server-amap-jitptfyoyw.cn-hangzhou.fcapp.run/sse
-
MCP 类型:SSE
-
对话测试。单击左侧新建对话,页面上方模型选择Qwen3-8B,在对话页面下方选择深度思考、搜索和MCP(激活amaps)。

-
步骤四:评估RAG系统性能
RAG系统内置评估模块,帮助您量化不同配置下的问答效果。以下是完整的评估流程:
-
新建数据集。单击左侧边栏评估,进入评估页面,选择新建数据集。

-
导入样本。单击创建好的数据集,进入评估任务。在样本页签下,单击导入数据。

-
新建运行配置。在运行设置页签下,单击新建配置,按需配置。

-
新建评估配置。在评估器设置页签下单击新建配置,按需选择配置和评估器类型。

-
运行评估实验。在样本页签,勾选要评估的样本,单击运行实验,填写实验名称,并按需选择运行配置和评估配置。

-
查看评估结果。创建实验成功后,会自动跳转到实验详情页面。也可以直接切换到运行历史页签,选择目标实验进入。

生产环境应用
使用阿里云向量数据库
PAI-RAG支持通过Elasticsearch、Milvus、Hologres、OpenSearch或RDS PostgreSQL构建向量检索库。
-
Hologres、ElasticSearch、Milvus、RDS PostgreSQL支持通过内网或公网访问,推荐使用内网访问。
-
OpenSearch只支持通过公网访问。
准备Elasticsearch实例
如无Elasticsearch实例,请登录阿里云Elasticsearch控制台,参考如下配置创建。详情请参见创建阿里云Elasticsearch实例。
-
地域和可用区:选择与EAS服务相同的地域。
-
专有网络:选择与EAS服务一致的VPC,以便通过内网访问。
-
实例类型:选择通用商业版。
-
场景初始化配置:选择通用场景。
服务配置
务必设置ElasticSearch实例允许自动创建索引:在Elasticsearch实例的页面,单击修改配置,将自动创建索引设置为允许自动创建索引。具体操作,请参见配置YML参数。
-
版本类型:选择Elasticsearch。
-
私网地址/端口:进入Elasticsearch实例详情页,在基本信息区域可获取私网地址和端口,格式为
http://<私网地址>:<私网端口>。 -
索引名称:系统会根据输入执行不同操作。
-
输入一个新名称:EAS 将在部署时自动创建符合 PAI-RAG 要求的索引。
阿里云Elasticsearch默认不允许自动创建索引。在Elasticsearch实例的页面,单击修改配置,更新YML文件配置,将自动创建索引设置为允许自动创建索引。具体操作,请参见配置YML参数。
-
输入已存在的名称:EAS 将直接使用该索引。请确保该索引由PAI-RAG服务创建,以保证结构兼容。
-
-
账号、密码:配置创建Elasticsearch实例时配置的登录名和密码。登录名默认为elastic。密码如忘记,可重置实例访问密码。
-
OSS地址:请选择当前地域下已创建的OSS存储目录。通过挂载OSS路径实现知识库管理。
通过Kibana管理索引
Elasticsearch提供了索引管理功能,详情请参见通过Kibana连接集群。
