Ellie
OpenAI Enablement团队成员,专注于API应用构建方法论的布道与推广
时间轴 (近 90 天)
OpenAI 官方 API Bootcamp 系列的第一场分享由 Enablement 团队的 Ellie 主讲
构建 API 应用应当先理解真正的问题,再考虑是否动用更多基础设施,技术选择应由需求驱动而非技术先进程度
构建 API 应用的三个典型陷阱是用例模糊、迷恋某种技术、以及没有清晰的验证方式
BCA 诊断框架将问题拆解为行为(Behavior)、上下文(Context)、行动(Action)三条车道,并加上贯穿始终的质量(Quality)维度
行为层有四个控制旋钮:Prompting、结构化输出、模型选择、推理强度,它们是不同的旋钮而非需要全部拧到最大
模型选择应用同一批代表性用例跑不同候选模型,比较分类准确率、敏感案例召回、延迟和成本,由评测而非模型标签做决定
上下文需求不等于必须搭建检索系统,只有在上万份不断变化的文档中找正确段落时才需要 RAG
在函数调用的三步流程中,应用(如 Acme)定义能力、模型用结构化参数请求调用、应用决定是否执行
当下一个被批准的步骤取决于系统沿途的发现时,Agent 才变得有用;步骤固定的场景适合 Workflow,简单问答适合 Chatbot
一个完整的 eval 由数据集、被测系统、评分器、指标四部分组成,评测时应每次只改一个变量并重跑同一批用例
全部知识事实 (10)
一个完整的 eval 由数据集、被测系统、评分器、指标四部分组成,评测时应每次只改一个变量并重跑同一批用例
50%待验证构建 API 应用应当先理解真正的问题,再考虑是否动用更多基础设施,技术选择应由需求驱动而非技术先进程度
50%待验证构建 API 应用的三个典型陷阱是用例模糊、迷恋某种技术、以及没有清晰的验证方式
50%待验证BCA 诊断框架将问题拆解为行为(Behavior)、上下文(Context)、行动(Action)三条车道,并加上贯穿始终的质量(Quality)维度
50%待验证行为层有四个控制旋钮:Prompting、结构化输出、模型选择、推理强度,它们是不同的旋钮而非需要全部拧到最大
50%待验证模型选择应用同一批代表性用例跑不同候选模型,比较分类准确率、敏感案例召回、延迟和成本,由评测而非模型标签做决定
50%待验证上下文需求不等于必须搭建检索系统,只有在上万份不断变化的文档中找正确段落时才需要 RAG
50%待验证在函数调用的三步流程中,应用(如 Acme)定义能力、模型用结构化参数请求调用、应用决定是否执行
50%待验证当下一个被批准的步骤取决于系统沿途的发现时,Agent 才变得有用;步骤固定的场景适合 Workflow,简单问答适合 Chatbot
50%待验证OpenAI 官方 API Bootcamp 系列的第一场分享由 Enablement 团队的 Ellie 主讲
50%