Skip to main content

了解模型适配的重要性

学习目标

完成本单元后,您将能够:

  • 探索模型适配性对特定任务的重要性。
  • 应用模型选择原则。
  • 有效测试模型,为您的任务找到最佳匹配模型。
  • 根据数据做出明智的决策,而不是凭空猜测。

模型适配的重要性

在 Prompt Builder(提示生成器)中,您可以选择由哪个模型来驱动您的提示。拥有选择就意味着需要做出决策——最新或最强大的模型并不总是最适合您任务的那一个。真正重要的是,模型在您的具体使用场景中表现如何。这意味着您需要进行测试和验证。

就像选择合适的烤箱一样。热风循环烤箱非常适合烤制食物,但可能会使精致的海绵蛋糕烤干。合适的工具取决于您要做什么,而唯一确定的方法就是亲自测试。

四大模型选择原则

原则一:任务针对性:不同的模型擅长不同的任务。擅长总结摘要的模型未必最适合创意写作。请针对您的具体使用场景进行测试。

原则二:看运行表现,而非发布日期:越新不代表越好。真正重要的是,模型在您的具体任务中表现如何。以实际结果为准。

原则三:成本与准确性的权衡:功能更强大的模型通常成本更高。有时,速度更快、成本更低的模型也能产生足够好的结果。通过测试找到适合您的平衡点。

原则四:一致性与可靠性:在生产环境中使用时,您需要稳定一致的结果。对模型进行多次测试,确保其输出质量水平稳定地达到您所需。

翻译对比示例

我们来看一个示例,了解为什么测试如此重要。

任务:将客户支持对话从英语翻译成西班牙语,供讲西班牙语的团队成员使用。

测试的模型:

  • 模型 A(较旧、广泛使用)
  • 模型 B(较新发布)

结果:

  • 模型 A:100 次测试翻译的准确率为 95%
  • 模型 B:100 次测试翻译的准确率为 87%

结论:针对此特定翻译任务,旧版模型 A 的表现比新版模型 B 高出 8 个百分点。团队选择了模型 A,并非因为它更新,而是因为它在特定需求上提供了更优异的结果。

模型选择指南

任务类型

推荐方法

文本摘要

测试多个模型;衡量关键信息的保留准确率

生成客户邮件

测试语气一致性与个性化准确度

数据提取

测试精确率(正确答案) vs. 召回率(找到所有答案)

内容改写

测试风格一致性与遵守指示情况

多语言任务

务必测试特定语言的模型;切勿假定通用模型的表现完全相同

测试方法论

选择您的模型。

  • 定义成功标准。 您的任务中,“好”是什么样的?确定 2 到 3 个可衡量的标准。
  • 创建测试数据。 准备 10 到 20 个符合实际使用情况的代表性示例。
  • 测试每个模型。 使用测试数据,针对每个候选模型运行您的提示。
  • 评估结果。 根据成功标准对每个输出进行评分。
  • 分析数据。 哪个模型在您的评估标准下胜出?差异是否显著?
  • 以数据为依据做出选择。 选择在您实际使用场景中表现最佳的模型,而非凭借声誉或发布日期来判断。

模型选择并不复杂。明确好坏的标准,用真实数据进行测试,让结果来指导您的决策。在最后一个单元中,您将把所有内容融会贯通,学习如何测试、迭代并将提示词部署到实际应用中。

在 Salesforce 帮助中分享 Trailhead 反馈

我们很想听听您使用 Trailhead 的经验——您现在可以随时从 Salesforce 帮助网站访问新的反馈表单。

了解更多 继续分享反馈