匠人学院 JR Academy学AI来匠人
匠人学院 JR Academy学AI来匠人

Follow Us

linkedinfacebooktwitterinstagramweiboyoutubebilibilitiktokxigua

We Accept

/image/layout/pay-paypal.png/image/layout/pay-visa.png/image/layout/pay-master-card.png/image/layout/pay-airwallex.png/image/layout/pay-alipay.png
EN

关于公司

关于我们元宇宙课堂新闻资讯匠人工作成为导师匠人导师联系我们匠人商店J3.Club

匠人资源

工作内推匠人活动1对1私教行业白皮书线上学习平台面试中心分享面试经验Internship会员中心

AI 工具

AI 工具箱考证匠 Cert Master求职匠 Job Hunter牛小匠 UniMate AI

AI 学习方向

全部学习方向AI EngineerContext EngineeringVibe CodingPrompt MasterAI BuilderAI 产品经理Python 入门

AI 应用提效

AI 办公提效AI 数据分析AI 财务AI 内容创作AI 视觉创作前端开发Hermes AgentOpenClaw 本地智能体

大学资源

墨尔本大学昆士兰大学新南威尔士大学悉尼大学莫那什大学阿德莱德大学RMITQUTUTS

少儿 AI 教育

Airbotix 少儿 AI 编程澳洲家长实用资料库NAPLAN 成绩单怎么看My School 学校数据指南悉尼私校学费 2026少儿编程课程与训练营

移民服务

澳洲移民技术移民189/190/491雇主担保482/186/494投资移民188/888英国移民美国移民加拿大移民

企业合作

P3职业孵化器Enterprise (EN)企业培训实习合作招聘合作申请合作

求职代理

岗位代投职位监控LinkedIn代运营LinkedIn人脉代加了解P3项目

匠人支持

FAQsTerms & ConditionsPrivacy PolicyCancellation & Refund PolicySite map

Top Categories

Web全栈班DevOps项目班数据工程全栈班数据分析项目班编程入门班Business Analyst实习算法集训营

求职就业

BA和产品经理实习数据科学实习数据分析实习Marketing实习简历修改面试指导导师指导VIP

地址

Level 10b, 144 Edward Street, Brisbane CBD(Headquarter)
Level 2, 171 La Trobe St, Melbourne VIC 3000
四川省成都市武侯区桂溪街道天府大道中段500号D5东方希望天祥广场B座45A13号
Business Hub, 155 Waymouth St, Adelaide SA 5000

联系方式

hello@jiangren.com.au0421-672-555

Disclaimer

footer-disclaimerfooter-disclaimer

JR Academy acknowledges Traditional Owners of Country throughout Australia and recognises the continuing connection to lands, waters and communities. We pay our respect to Aboriginal and Torres Strait Islander cultures; and to Elders past and present. Aboriginal and Torres Strait Islander peoples should be aware that this website may contain images or names of people who have since passed away.

匠人学院网站上的所有内容,包括课程材料、徽标和匠人学院网站上提供的信息,均受澳大利亚政府知识产权法的保护。严禁未经授权使用、销售、分发、复制或修改。违规行为可能会导致法律诉讼。通过访问我们的网站,您同意尊重我们的知识产权。JR Academy Pty Ltd 保留所有权利,包括专利、商标和版权。任何侵权行为都将受到法律追究。查看用户协议

© 2017-2026 JR Academy Pty Ltd. All rights reserved.

ABN 26621887572

目录

  • CrewAI 是什么:让多个 AI Agent 组队干活
  • 快速上手:安装 CrewAI 并跑通第一个 Crew
  • 核心功能:Agent、Task、Crew、Tool 深度拆解
  • 进阶技巧:Flow 编排、Memory 记忆、多模型混用
  • 常见问题:定价、踩坑、选型指南
  • 测试与调试:用 crewai test 量化 Crew 表现
  • 生产上线:FastAPI 封装 + Docker 容器化 + 断点续跑
  • Knowledge 知识库:让 Agent 读懂你的私有文档
back返回
setting
匠人Wiki百科/CrewAI 实战手册:用 Python 编排多 Agent 协作

测试与调试:用 crewai test 量化 Crew 表现

为什么多 Agent 比单模型更难测

调试单个 LLM 调用,你只需要看输入输出。调试一个 Crew,你面对的是:

  • 哪个 Agent 输出了错误信息?
  • Task 描述不清还是 Agent backstory 有问题?
  • 是这次 LLM 返回异常,还是每次都差?

CrewAI 提供了一套完整的测试工具链来回答这些问题。

crewai test:一条命令得到量化评分

crewai test 是最快的质量基线工具。它会将你的 Crew 运行 N 次,然后用一个评审 LLM 给每个任务打分(1-10)。

# 跑 3 次,用 gpt-4o-mini 作为评审(便宜,够用)
crewai test -n 3 -m gpt-4o-mini

输出示例:

Task                  | Run 1 | Run 2 | Run 3 | Avg
─────────────────────────────────────────────────
search_task           |   7.5 |   8.0 |   7.0 | 7.5
compare_task          |   6.0 |   7.5 |   6.5 | 6.7
advise_task           |   8.5 |   9.0 | 🔴 Err | 7.8*
─────────────────────────────────────────────────
Crew Overall Score    |  7.3  |  8.2  |  6.8  | 7.4
Total Execution Time  |  142s | 128s  | 99s   |

重点看两个信号:

  1. 方差大的任务(Run 1 和 Run 3 差 2 分以上)→ 该任务描述不够稳健,Agent 理解不一致
  2. 持续低分任务(平均 < 6)→ 说明 expected_output 定义不清,或者 Agent backstory 不匹配

你也可以在代码里调用 crew.test():

from crewai import Crew, Process

crew = Crew(
    agents=[scout, analyst, strategist],
    tasks=[scan_task, compare_task, advise_task],
    process=Process.sequential
)

# n_iterations=3, openai_model_name 用便宜的
crew.test(n_iterations=3, openai_model_name="gpt-4o-mini")

crewai train:用人工反馈训练 Agent

发现某个 Agent 输出总是方向跑偏?用 crewai train 收集人工评分,把这些评分作为示例喂给 Agent:

crewai train -n 5 -m gpt-4o-mini

运行期间,每次执行后系统会提示你对 Agent 输出评分(1-10)并提供文字反馈。训练结果保存在本地的 trained_agents_data.pkl,下次 crew.kickoff() 时自动加载。

# 启动时自动应用训练数据(默认行为)
crew.kickoff(inputs={"product": "CrewAI"})

# 禁用训练数据(想用原始表现对比时)
crew.kickoff(inputs={"product": "CrewAI"}, reset_memory_before_execution=True)

何时该 train? 至少跑 test 发现某个任务平均分 < 7,才值得开始训练。直接 train 而不先测基线,无法判断有没有提升。

verbose 模式:按行追踪 Agent 思考链

生产前必过的关:开 verbose=True 看完整的 ReAct 循环。

crew = Crew(
    agents=[scout, analyst, strategist],
    tasks=[scan_task, compare_task, advise_task],
    verbose=True          # 打印每个 Agent 的思考 + 行动 + 观察
)

输出每个步骤长这样:

[Scout] Thought: I need to search for competitors of CrewAI...
[Scout] Action: Search("CrewAI competitors 2026")
[Scout] Observation: Found LangGraph, AutoGen, Dify...
[Scout] Final Answer: Here are the top 5 competitors...

看到 Agent 陷入循环(同一个 Action 出现 3 次以上),立即检查:

  • 工具是否真的返回了有用内容?
  • expected_output 是否让 Agent 知道什么时候该停?

crewai replay:回放失败的任务

长跑 Crew(10 个任务以上)跑到第 8 步挂了?不需要从头来:

# 列出上次运行的所有任务 ID
crewai log-tasks-outputs

# 从第 8 个任务(task_id 是 7,从 0 开始)重新跑
crewai replay -t 7

replay 会复用之前任务的输出作为上下文,只重跑你指定的任务及其后续。这在调试耗时 / 耗钱的 Crew 时省大量成本。

DeepEval:自动化评估 + CI 集成

crewai test 是手动触发,要进 CI 流水线就需要 DeepEval:

pip install deepeval crewai
from deepeval.integrations.crewai import DeepEvalCrewObserver
from deepeval.metrics import AnswerRelevancyMetric, FaithfulnessMetric

# 注册观察器——一行代码,不改任何 Crew 逻辑
DeepEvalCrewObserver()

# 定义评估指标
metrics = [
    AnswerRelevancyMetric(threshold=0.7),
    FaithfulnessMetric(threshold=0.8)
]

# 正常 kickoff,DeepEval 自动捕获所有 span
result = crew.kickoff(inputs={"product": "CrewAI"})

# 查看评估报告
# deepeval test run 或登录 confident-ai.com 看可视化

CI 里加这一步,每次 PR 合并前自动验证 Crew 表现没有退步。

调试速查表

症状先检查解决方向
Agent 输出与预期方向完全不同backstory 和 goal 是否清晰重写 Agent 定义,加具体约束
每次结果差异很大expected_output 是否太模糊在 expected_output 里加格式要求
工具调用失败工具 API key / 网络是否正常先单独测试工具,加 max_retry_limit=3
任务 N+1 没有用到任务 N 的结果context=[task_n] 有没有加显式声明任务依赖
Crew 跑了 30 分钟没结果max_iter 是否太高设 max_iter=5,用 replay 调试
本章目录

    相关 Wiki 推荐

    匠人学院使用指南AI Engineer 完全指南GitHub Copilot 实战指南Continue 实战手册:开源 AI 编程助手完全指南Vercel AI SDK 实战指南Aider AI 结对编程实战指南
    Lightman Wang
    Reviewer: Lightman WangFounder of JR Academy