匠人学院 JR Academy学AI来匠人
匠人学院 JR Academy学AI来匠人

Follow Us

linkedinfacebooktwitterinstagramweiboyoutubebilibilitiktokxigua

We Accept

/image/layout/pay-paypal.png/image/layout/pay-visa.png/image/layout/pay-master-card.png/image/layout/pay-airwallex.png/image/layout/pay-alipay.png
EN

关于公司

关于我们元宇宙课堂新闻资讯匠人工作成为导师匠人导师联系我们匠人商店J3.Club

匠人资源

工作内推匠人活动1对1私教行业白皮书线上学习平台面试中心分享面试经验Internship会员中心

AI 工具

AI 工具箱考证匠 Cert Master求职匠 Job Hunter牛小匠 UniMate AI

AI 学习方向

全部学习方向AI EngineerContext EngineeringVibe CodingPrompt MasterAI BuilderAI 产品经理Python 入门

AI 应用提效

AI 办公提效AI 数据分析AI 财务AI 内容创作AI 视觉创作前端开发Hermes AgentOpenClaw 本地智能体

大学资源

墨尔本大学昆士兰大学新南威尔士大学悉尼大学莫那什大学阿德莱德大学RMITQUTUTS

少儿 AI 教育

Airbotix 少儿 AI 编程澳洲家长实用资料库NAPLAN 成绩单怎么看My School 学校数据指南悉尼私校学费 2026少儿编程课程与训练营

移民服务

澳洲移民技术移民189/190/491雇主担保482/186/494投资移民188/888英国移民美国移民加拿大移民

企业合作

P3职业孵化器Enterprise (EN)企业培训实习合作招聘合作申请合作

求职代理

岗位代投职位监控LinkedIn代运营LinkedIn人脉代加了解P3项目

匠人支持

FAQsTerms & ConditionsPrivacy PolicyCancellation & Refund PolicySite map

Top Categories

Web全栈班DevOps项目班数据工程全栈班数据分析项目班编程入门班Business Analyst实习算法集训营

求职就业

BA和产品经理实习数据科学实习数据分析实习Marketing实习简历修改面试指导导师指导VIP

地址

Level 10b, 144 Edward Street, Brisbane CBD(Headquarter)
Level 2, 171 La Trobe St, Melbourne VIC 3000
四川省成都市武侯区桂溪街道天府大道中段500号D5东方希望天祥广场B座45A13号
Business Hub, 155 Waymouth St, Adelaide SA 5000

联系方式

hello@jiangren.com.au0421-672-555

Disclaimer

footer-disclaimerfooter-disclaimer

JR Academy acknowledges Traditional Owners of Country throughout Australia and recognises the continuing connection to lands, waters and communities. We pay our respect to Aboriginal and Torres Strait Islander cultures; and to Elders past and present. Aboriginal and Torres Strait Islander peoples should be aware that this website may contain images or names of people who have since passed away.

匠人学院网站上的所有内容,包括课程材料、徽标和匠人学院网站上提供的信息,均受澳大利亚政府知识产权法的保护。严禁未经授权使用、销售、分发、复制或修改。违规行为可能会导致法律诉讼。通过访问我们的网站,您同意尊重我们的知识产权。JR Academy Pty Ltd 保留所有权利,包括专利、商标和版权。任何侵权行为都将受到法律追究。查看用户协议

© 2017-2026 JR Academy Pty Ltd. All rights reserved.

ABN 26621887572

首页/资源中心/文章详情
JR Academy · Blog职业洞察

Prompt Engineering 实战指南 — Prompt 调试与评估:用数据衡量 Prompt 质量

Prompt 写完不算完,要测、要量化、要迭代。本章讲如何搭建评估流水线,用 eval 数据集对比不同版本 Prompt 的效果

发布日期2026-09-20
阅读时长2 分钟
作者

快速导航

  • Prompt 不是写一次就完的
  • 搭建 Eval 数据集
  • 自动化评估脚本
  • LLM-as-Judge:用 AI 评估 AI
  • Prompt 版本管理

Prompt 评估流水线

Prompt 不是写一次就完的

写代码有单元测试,写 Prompt 也需要测试。区别在于 AI 的输出不是二进制对错,而是一个"质量谱" —— 同一个 Prompt 跑 10 次可能出 8 次好结果、2 次差结果。

Prompt 调试的核心问题:怎么知道改了之后是变好了还是变差了? 靠感觉不行,需要 eval(评估)。


搭建 Eval 数据集

Eval 数据集就是一组"输入 + 期望输出"的测试用例。至少 20 条,覆盖核心场景和边界情况:

EVAL_DATASET = [
    {
        "input": "用 Python 写一个二分查找",
        "expected_keywords": ["def binary_search", "left", "right", "mid"],
        "expected_not": ["import numpy", "递归"],  # 不该出现的内容
        "category": "code_generation"
    },
    {
        "input": "这段代码有什么 bug?\ndef add(a, b): return a - b",
        "expected_keywords": ["减法", "a + b", "bug"],
        "category": "code_review"
    },
    {
        "input": "用一句话解释什么是 REST API",
        "max_length": 100,  # 不超过 100 字
        "category": "explanation"
    },
]

数据集的黄金法则:先从生产环境里收集真实的失败案例,不要自己编。用户实际踩过的坑比你想象的边界情况更有价值。


自动化评估脚本

import anthropic
import json

client = anthropic.Anthropic()

def run_eval(prompt_template: str, dataset: list[dict]) -> dict:
    results = {"pass": 0, "fail": 0, "details": []}

    for case in dataset:
        response = client.messages.create(
            model="claude-sonnet-4-6",
            max_tokens=2048,
            temperature=0,
            messages=[{"role": "user", "content": prompt_template.format(input=case["input"])}],
        )
        output = response.content[0].text

        # 检查关键词命中
        passed = True
        reasons = []

        for kw in case.get("expected_keywords", []):
            if kw.lower() not in output.lower():
                passed = False
                reasons.append(f"缺少关键词: {kw}")

        for kw in case.get("expected_not", []):
            if kw.lower() in output.lower():
                passed = False
                reasons.append(f"包含禁止内容: {kw}")

        if "max_length" in case and len(output) > case["max_length"]:
            passed = False
            reasons.append(f"超长: {len(output)} > {case['max_length']}")

        results["pass" if passed else "fail"] += 1
        results["details"].append({
            "input": case["input"][:50],
            "passed": passed,
            "reasons": reasons
        })

    results["score"] = results["pass"] / len(dataset) * 100
    return results

跑两个版本的 Prompt,对比 score:

v1_score = run_eval(PROMPT_V1, EVAL_DATASET)
v2_score = run_eval(PROMPT_V2, EVAL_DATASET)

print(f"V1: {v1_score['score']:.0f}%  V2: {v2_score['score']:.0f}%")
# V1: 75%  V2: 90% → V2 上线

LLM-as-Judge:用 AI 评估 AI

关键词匹配太粗糙?用另一个模型当评委,打分更细腻:

JUDGE_PROMPT = """
评估以下 AI 回答的质量,从 1-5 分打分:

<criteria>
- 准确性:信息是否正确(2分)
- 完整性:是否覆盖了关键点(1.5分)
- 简洁性:是否有废话或冗余(1分)
- 格式:是否符合要求(0.5分)
</criteria>

<question>{question}</question>
<answer>{answer}</answer>

严格按 JSON 输出:{{"score": 数字, "breakdown": {{"accuracy": 数字, "completeness": 数字, "conciseness": 数字, "format": 数字}}, "reason": "一句话"}}
"""

def llm_judge(question: str, answer: str) -> dict:
    response = client.messages.create(
        model="claude-opus-4-6",  # 用更强的模型当评委
        max_tokens=256,
        temperature=0,
        messages=[{"role": "user", "content": JUDGE_PROMPT.format(question=question, answer=answer)}],
    )
    return json.loads(response.content[0].text)

LLM-as-Judge 的局限:评委本身也可能犯错。重要决策建议抽样 10% 做人工复核,校准 AI 评委的偏差。


Prompt 版本管理

生产环境的 Prompt 要像代码一样做版本管理:

prompts/
├── code_review/
│   ├── v1.txt          # 初版
│   ├── v2.txt          # 加了 XML 结构
│   ├── v3.txt          # 优化了 Few-shot 示例
│   └── eval_results.json  # 每个版本的测试分数
├── content_writer/
│   ├── v1.txt
│   └── v2.txt
└── run_eval.py         # 评估脚本

每次改 Prompt 之前先跑 eval,改完再跑。分数降了就回滚,分数升了才部署。这比"我觉得新版更好"靠谱得多。

作者
一键分享或复制链接
Lightman Wang
Reviewer: Lightman Wang

Founder of JR Academy

查看该作者的更多文章 →

相关学习资源

  • Prompt Master 学习路径
← 上一篇Prompt Engineering 实战指南 — Agentic Prompt 设计:让 AI 自主完成多步任务下一篇 →Prompt Engineering 实战指南 — Prompt 安全:防注入、防泄漏、防越狱

相关文章推荐

太狠了太狠了😭 NVIDIA这个AI免费项目真的太狠了

2026-09-21

GitHub Copilot 实战指南 — 常见问题、定价与选型建议

2026-09-20

GitHub Copilot 实战指南 — 进阶玩法:Coding Agent、自定义指令与 MCP

2026-09-20

GitHub Copilot 实战指南 — 核心功能深度解析:补全、Chat 与 Agent Mode

2026-09-20

GitHub Copilot 实战指南 — 快速上手:注册免费版 + 第一次 AI 编程

2026-09-20

GitHub Copilot 实战指南 — GitHub Copilot 是什么:全球最大的 AI 编程助手

2026-09-20
查看全部文章 →
JR Academy
全球华人学习 AI 第一站
✓15000+ 学员
✓50+ 课程
✓AI 驱动学习平台
训练营免费资源AI学习职业辅导
精选推荐
AI 职业影响地图
测测你的职业风险等级,查看转型路径与学习方向
热门工具
AI & 数据训练营
系统化课程 + 真实项目实战,快速提升竞争力
热门课程
1v1 就业辅导
资深导师一对一指导,简历优化 + 面试准备
就业保障
企业内训定制
AI 技能培训方案,助力团队升级
企业服务
热门标签
Vibe CodingAI 编程CursorClaude求职攻略Prompt前端开发后端开发
订阅更新

获取最新 AI 学习资源、技术教程和求职攻略,直接送达邮箱。

我们尊重您的隐私,不会发送垃圾邮件