摘要
当您在 Astra 中创建 AI 智能体时,系统不仅会为您生成它,还会自动生成测试用例,帮助您从一开始就评估并改进您的智能体,无需您费心处理剩余工作。
本文将介绍自动化测试、提示词(Prompt)优化和评估仪表板如何协同工作,助您以更少的人工投入,顺利上线可靠且高性能的智能体。
说明
自动化智能体评估的工作原理
智能体一经创建,Astra 就会自动生成测试用例。这免去了手动设置测试的麻烦,并减少了反复调试所需的时间。
当您打开评估(Evaluation)页面时,您将看到一组根据您智能体当前指令自动生成的测试用例。
这些测试用例建立了性能基准,帮助您了解智能体在不同对话类型、极端情况和风险场景下的响应表现。这些场景涵盖了从标准查询到复杂问题的各种情况。
如何运行评估并查看结果
更喜欢可视化演示?请观看我们的视频指南,了解如何评估您的 Astra AI 智能体:
您可以从列表中选择特定的测试用例来运行评估,也可以点击全部运行(Run all)一次性评估所有可用的测试用例。
评估完成后,系统将实时展示智能体的表现。这有助于您快速识别不清晰、不完整或相互冲突的指令。
您将看到总体评估结果,包括:
效率得分(Efficiency score) – AI 智能体处理问题的表现如何。
准确性(Accuracy) – AI 智能体响应的正确程度。
延迟(Latency) – AI 智能体响应的速度。
您还可以在评估摘要中查看以下详细信息:
问题(Question) – 用于评估 AI 智能体的测试问题。
类别(Category) – 问题的类型,例如标准查询(standard query)、隐含问题(implied problem)或无关问题(off-topic question)。
预期答案(Expected answer) – 预期 AI 智能体应提供的响应。
AI 响应(AI response) – AI 智能体实际生成的响应。
指标(Metrics) – 显示该响应的效率得分。
状态(Status) – 指示 AI 智能体在评估中是通过还是失败。
备注(Notes) – 显示有关测试用例的附加信息,例如问题是自动生成、通过 CSV 上传还是手动添加的。
您可以点击任何单独的测试用例来查看详细结果,包括:
评估摘要(Evaluation Summary) – 关于智能体如何响应以及为何通过或失败的详细分析。
预期行为(Expected Behaviour) – 智能体本应提供的正确或理想的响应。
每个结果都包含对智能体如何解读用户输入以及是否正确响应的详细解释。这使您能够更轻松地发现差距并精确优化您的指令。
您需要执行的操作:
审查每个测试用例的结果。
对比智能体的响应与评估摘要。
检查响应是否符合预期行为。
如何查看 AI 分析和建议
点击分析结果(Analyse results)以查看评估结果。系统可能需要片刻时间来处理分析。
分析完成后,点击查看建议(View recommendation)以查看 AI 驱动的优化建议。
系统会总结主要问题,并提供切实可行的建议,以提高智能体的准确性和可靠性。
请仔细审查高优先级建议。这些建议可能包括为特定请求添加明确规则,或为订单跟踪等复杂任务定义分步指令。
如何更新智能体指令
查看建议后,点击更新指令(Update instructions)即可自动应用改进。此功能有助于简化利用真实测试和分析所得见解来精简智能体的过程。系统需要片刻时间来处理并显示结果。
审查并应用更改
审查更新后的指令(Review updated instructions)屏幕将显示拟议的更改。在这里,您可以看到新的规则和指南是如何添加到智能体现有指令中的。
优化后:
门户会突出显示拟议的更新。
您可以清楚地看到修改的内容和原因。
请仔细审查建议的改进措施。
浏览更新后的指令,确保它们符合您的要求。
确认 AI 建议与您的品牌声音和业务流程保持一致。
点击接受(Accept)以完成更新。
再次运行评估
保存更改后,再次点击全部运行(Run all),使用相同的测试用例对智能体进行重新评估。系统将使用更新后的指令运行评估。测试完成后,您应该会看到所有场景均已通过。
这一过程展示了分析和建议功能如何帮助您迭代改进并优化 AI 智能体的性能。










