跳至主要內容

如何使用 Astra 的自動化代理評估來部署可靠的 AI 代理

總結

當您在 Astra 中建立 AI 代理時,系統不僅僅是產生它並讓您自行處理後續事宜。它會自動產生測試案例,幫助您從一開始就評估並改進您的代理。

本文說明自動化測試、提示詞優化和評估儀表板如何協同運作,協助您以更少的手動工作量,輕鬆啟用可靠且高效能的代理。

說明

自動化代理評估的運作方式

您的代理一經建立,Astra 就會自動產生測試案例。這省去了手動設定測試的需求,並減少了嘗試錯誤所花費的時間。

當您開啟評估 (Evaluation) 頁面時,您會看到一組根據代理目前指令自動產生的測試案例。

這些測試案例建立了效能基準。它們有助於您了解代理在不同對話類型、邊緣案例和風險場景中的回應方式。這些場景涵蓋從標準查詢到複雜問題的各種情況。

如何執行評估並查看結果

偏好視覺化操作指南嗎?請觀看我們關於如何評估 Astra AI 代理的影片指南:

您可以從清單中選取特定的測試案例來執行評估,或點選全部執行 (Run all) 來同時評估所有可用的測試案例。

評估完成後,系統會即時向您顯示代理的執行狀況。這有助於您快速識別不明確、不完整或相互衝突的指令。

您將看到整體評估結果,包括:

  • 效率評分 (Efficiency score) – AI 代理處理問題的能力。

  • 準確度 (Accuracy) – AI 代理回應的正確程度。

  • 延遲 (Latency) – AI 代理回應的速度。

您也可以在評估摘要 (evaluation summary) 中查看以下詳細資訊:

  • 問題 (Question) – 用於評估 AI 代理的測試問題。

  • 類別 (Category) – 問題類型,例如標準查詢 (standard query)隱含問題 (implied problem)離題問題 (off-topic question)

  • 預期答案 (Expected answer) – AI 代理預期提供的回應。

  • AI 回應 (AI response) – AI 代理實際產生的回應。

  • 指標 (Metrics) – 顯示回應的效率評分 (efficiency score)

  • 狀態 (Status) – 指出 AI 代理在評估中是通過還是失敗 (passed or failed)

  • 備註 (Notes) – 顯示關於該測試案例的其他資訊,例如問題是自動產生 (auto-generated)透過 CSV 上傳 (uploaded via CSV) 還是手動新增 (added manually)

您可以點選任何個別測試案例以查看詳細結果,包括:

  • 評估摘要 (Evaluation Summary) – 代理如何回應以及為何通過或失敗的細項分析。

  • 預期行為 (Expected Behaviour) – 代理應該提供的正確或理想回應。

每個結果都包含對代理如何解讀使用者輸入以及回應是否正確的詳細解釋。這使您可以更輕鬆地發現差距,並精確地修正您的指令。

您需要做的:

  • 檢閱每個測試案例的結果。

  • 將代理的回應與評估摘要進行比較。

  • 檢查回應是否符合預期行為。

如何查看 AI 分析與建議

點選分析結果 (Analyse results) 以檢閱評估結果。系統可能需要一些時間來處理分析。

分析完成後,點選檢視建議 (View recommendation) 以查看 AI 驅動的優化建議 (AI-powered optimization suggestions)

系統會總結主要問題,並提供切實可行的建議,以提升代理的準確度和可靠性。

請仔細檢閱高優先級建議 (high-priority suggestions)。這些建議可能包括為特定請求新增明確規則,或為複雜任務(如訂單追蹤)定義逐步操作指南。

如何更新代理指令

檢閱建議後,點選更新指令 (Update instructions) 以自動套用改進。此功能有助於簡化使用來自真實測試與分析的洞察來優化代理的過程。這需要一些時間,隨後將顯示結果。

檢閱並套用變更

檢閱更新後的指令 (Review updated instructions) 畫面將顯示建議的變更。在此,您可以查看新的規則與指導方針如何新增至代理現有的指令中。

優化後:

  • 入口網站會標示建議的更新。

  • 您可以清楚地看到修改了什麼以及原因。

  • 請仔細檢閱建議的改進。

瀏覽更新後的指令以確保它們符合您的要求。

確認 AI 建議符合您的品牌語氣 (brand voice)業務流程 (business processes)

點選接受 (Accept) 以完成更新。

再次執行評估

儲存變更後,再次點選全部執行 (Run all),使用相同的測試案例重新評估代理。系統將以更新後的指令執行評估。當測試完成時,您應該會看到所有場景皆已通過。

此過程展示了分析與建議功能如何協助您反覆改進並優化 AI 代理的效能。

是否回答了您的問題?