一次跑出10个候选提示并自动排名,gpt-prompt-engineer 完整上手指南
一次跑出10个候选提示并自动排名gpt-prompt-engineer 完整上手指南【免费下载链接】gpt-prompt-engineergpt-prompt-engineer - 一个工具用于自动化生成、测试和排名多种提示以找到最适合特定任务的提示。项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-prompt-engineer写提示词最耗时间的不是写本身而是反复试。gpt-prompt-engineer 是一个开源工具你提供任务描述和测试用例它自动生成一批候选提示逐个跑测试再用 ELO 评分排名最后输出一张谁好谁差的表。整件事从手动变成交给脚本。先看手动试错卡在哪里人工调提示基本是三步改一句、跑一遍、凭感觉判断好不好。用例多一点量就上去了。而且凭感觉没有记录换个用例之前的结论未必还成立。测试用例少、结果好坏没有量化标准时这两个问题尤其明显。这个工具的定位就是替代改-跑-判断这个循环生成、测试、排名全部自动化你只负责给输入和看结果。 一个调用背后发生了什么准备工作很轻。你只需要两样东西一段任务描述比如根据提示生成 landing page 标题这类句式效果较好一组测试用例每条是一个具体的 promptdescription Given a prompt, generate a landing page headline test_cases [ {prompt: Promoting an innovative new fitness app, Smartly}, {prompt: Why a vegan diet is beneficial for your health}, ]然后执行一次调用generate_optimal_prompt(description, test_cases, number_of_prompts10)之后脚本会依次做三件事。先用 GPT-4、GPT-3.5-Turbo 或 Claude 3 Opus 这类模型基于你的描述和用例生成一批候选提示再让每个提示分别回答全部测试用例最后把生成结果两两对比、打分、排名。生成的候选提示会刻意避开测试用例的细节避免背题。⚖️ ELO 评分如何判断提示好坏排名用的是一套 ELO 评分系统来源是棋类排名。规则不复杂每个候选提示的初始分都是 1200两个提示针对同一用例的输出相互比较胜者加分、败者减分调整幅度由系数 K 控制notebook 里默认 32跑完后会打印一张按分数从高到低排序的表哪条提示最稳一目了然。分数高不等于完美只说明它在你的测试用例集合上表现更好换一批用例排名可能变化。生成提示、执行测试、评估结果分别由不同模型参数控制如CANDIDATE_MODEL、GENERATION_MODEL、RANKING_MODEL可以按需替换比如用便宜模型跑生成、用强模型做评估。 从零到第一张排名表的步骤选运行方式用 Google Colab 打开 gpt_prompt_engineer.ipynb 最省事本地则克隆仓库后在 Jupyter 里打开仓库地址是git clone https://gitcode.com/GitHub_Trending/gp/gpt-prompt-engineer填 API KeyGPT 系列版本填openai.api_keyClaude 版本填ANTHROPIC_API_KEY写入任务描述和测试用例设置生成数量建议从 10 个开始运行generate_optimal_prompt等排名表输出五个版本分别适合什么任务仓库里每个 notebook 对应一个场景gpt_prompt_engineer.ipynb基础版通用任务GPT-4 与 GPT-3.5-Turbogpt_prompt_engineer_Classification_Version.ipynb分类任务专用。测试用例要带预期输出如true/false评分按精确匹配统计输出每条提示的得分表claude_prompt_engineer.ipynb基于 Claude 3 Opus能自动生成测试用例还支持定义多个输入变量如发件人、收件人姓名opus_to_haiku_conversion.ipynb先用 Opus 产出高质量示例再让 Haiku 照着生成保留质量的同时降低单次生成的延迟和费用其余如gpt_planner.ipynb是配套实验 notebook选择逻辑通用文案生成用基础版二分类判断用分类版要省成本、用 Claude 生态就从 Opus 起步再转 Haiku。⚠️ 开始之前要知道的事费用随生成数量增长候选提示越多、测试用例越多API 调用量越大README 明确提醒大量生成会比较贵10 个是推荐起点排名只反映你给的测试用例用例太少或太偏结论不可外推想留痕可以开两个开关use_wandbTrue把配置、提示内容、用例和最终 ELO 写入 Weights Biasesuse_portkeyTrue记录整条提示链和响应项目是 MIT 许可商用没有障碍社区也在讨论多风格提示生成器、更多分类类别等扩展如果你现在手上已经有一个写死的提示词最直接的动作是把 gpt_prompt_engineer.ipynb 拷进 Colab填入真实的任务描述和 8 到 10 条测试用例让number_of_prompts从 10 开始跑一轮看排名表里第一名是否明显压过第二名——这能帮你判断这个任务到底值不值得继续深挖提示。【免费下载链接】gpt-prompt-engineergpt-prompt-engineer - 一个工具用于自动化生成、测试和排名多种提示以找到最适合特定任务的提示。项目地址: https://gitcode.com/GitHub_Trending/gp/gpt-prompt-engineer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考