基于开放权重模型的 LoRA

微调模型,
就用你自己的对话

在收件箱中为智能体的回复评分并修正答偏的回复,用这些问答对微调开放权重模型,再让智能体使用训练结果——那些你不得不在提示词里反复解释的语气,从此写进了模型权重。

数据集、训练、智能体

三个步骤,全部在模型将要工作的那个工作区内完成。

1

构建数据集

在收件箱的会话中选择训练数据集,给值得保留的 AI 回复点 👍,并改进答偏的回复。每个问答对都要等你纳入或排除,才会有内容被发送去训练。

2

选择基础模型并训练

选择开放权重基础模型,数据集导出后查看预估费用,沿用默认超参数或自行调整,然后开始运行。

3

让智能体使用它

训练完成的适配器会出现在智能体模型选择器的 My Adapters 下。让一个智能体使用它,在收件箱里用“Run with…”以该智能体重放真实的顾客消息,留下回答更好的那个。

无需另起一套技术栈的微调

不用提供商控制台,不用预留算力,不用签合同——与其他所有功能共用同一个额度余额。

用你审过的回复来训练

训练问答对来自你的收件箱:你点过 👍 的 AI 回复、回复答偏时你写的修正、智能体记忆中的高分片段,以及你手动添加的问答——而不是为让模型模仿而编造的示例。

更小的模型,同样守规矩

语气和用词一旦写进权重,就不再在每次调用时消耗提示词 Token——这通常意味着,原本需要大模型的工作,可以交给更小、更快的模型完成。

开始前先看预估

数据集导出后,训练对话框会在运行前显示预估费用和训练 Token 数。运行完成时才扣费,从与其他功能相同的额度余额中扣除——无需单独签约,也无需预留算力。

一个下拉框,而不是一次迁移

训练完成的适配器会作为模型出现在智能体的选择列表中,与托管的模型提供商并列。让一个智能体用上它,对比一下,留下回答更好的那个。

任务进度清晰可见

数据集、训练任务和已完成的适配器各有自己的列表,每次运行的状态、基础模型和成本一目了然,而不是埋在提供商的控制台里。

单独的权限控制

训练数据由真实的客户对话组成,所以整个功能——包括候选会话列表——都有独立于工作区其他部分的专属权限。

流水线支持哪些功能

从输入的对话,到智能体调用的适配器。

数据集

  • 由收件箱中评分并修正过的 AI 回复构建
  • 每个候选问答对在导出前都等待纳入或排除
  • 数据集详情视图,显示将用于训练的内容
  • 可在多次训练中重复使用

基础模型

  • 开放权重系列:Llama、Qwen、Mistral 和 Mixtral
  • DeepSeek R1 蒸馏模型与 gpt-oss
  • 显示每个模型的参数量
  • 数据集导出后显示预估费用
  • 训练服务商可微调的基础模型精选列表

训练任务

  • LoRA 适配器,每个超参数都有合理的默认值
  • 每次运行的任务状态和历史
  • 成本记录在对应的运行上
  • 失败会明确显示,而不是无休止地静默重试

部署服务

  • 适配器作为一个模型提供商出现在智能体的模型选择中
  • 按基础模型的推理单价乘以适配器的溢价倍数计费
  • 工作区内任意智能体都可使用
  • 可按智能体、按节点切换

控制

  • 专属的权限键,训练是单独的操作权限
  • 候选对话受同一权限键保护
  • JSONL 上传到训练服务商 Together AI 之前,先清除电话号码和邮箱
  • 不会与其他数据混用,也不会用于训练其他任何模型

成本

  • 与平台其他功能共用同一个额度余额
  • 无订阅费,不按席位收费
  • 运行前显示预估,运行后按实际费用扣费

微调后的模型带来什么变化

成本和不一致究竟花在了哪里。

没有 2pm.space 时
有了 2pm.space

每一次调用都要用 2,000 Token 的系统提示词重新解释你的语气

语气和用词写进权重,只需付费一次

因为小模型守不住品牌风格,只好用最大的模型

微调后的小模型同样守规矩,单次调用成本只是零头

明明已有对话记录,却还要为这个领域编写合成训练示例

由你已评分并修正过的 AI 回复构建的数据集

在提供商控制台里训练,与模型实际使用的地方完全脱节

数据集、训练和部署的适配器,与智能体在同一个工作区

关于微调的问题

团队在用客户对话训练模型之前会核实的事。

提示词告诉模型做什么;微调教会它按你的方式去做。一旦语气、商品用语和好回复的样子写进了权重,你就不必在每条提示词里为它们付费——这通常意味着,以前需要大模型的工作,可以交给更小、更便宜、更快的模型完成。

来自你的收件箱。在会话设置中选择训练数据集,然后为智能体的回复评分——点了 👍 的回复成为候选——再用“改进”写出这条回复本该怎么答;这条修正也会成为训练问答对。智能体记忆评分达到 8/10 及以上的片段可以自动纳入,你也可以手动添加问答对。团队成员自己写的回复不会被收集。每个问答对导出前都要等你纳入;由于这些都是真实的顾客消息,整个功能都有单独的权限,与工作区其他部分分开。

只能是开放权重模型,因为 Claude、GPT 这类托管模型无法用 LoRA 微调。列表是训练服务商可微调模型的精选集合——Llama、Qwen、Mistral、Mixtral、DeepSeek R1 蒸馏模型和 gpt-oss,参数量从 1B 到 120B——每个都标出参数量。

训练按基础模型单价、以每百万 Token 计量,并有服务商的单次最低收费;数据集导出后,训练对话框会显示预估费用。运行完成时扣费,从与其他功能相同的额度余额中扣除。训练完成后,适配器按其基础模型的推理单价乘以适配器的溢价倍数计费。无订阅费,也不按席位收费——用量计费的方式请参见价格页面。

它会出现在智能体模型下拉菜单的 My Adapters 下,与托管服务商并列。让一个智能体使用它,在收件箱里用“Run with…”重放真实的顾客消息,留下回答更好的那个——切换只是下拉选择,不是迁移。

不会。在你的工作区中构建的数据集,训练的是属于你工作区的适配器,平台不会把它与其他租户汇集或共享。训练时,导出的 JSONL——已清除电话号码和邮箱——会上传到训练服务商 Together AI,由它运行微调并提供你的智能体调用的适配器。

训练一个 说话就像你的模型

用智能体已经给出的回复构建数据集。免费开始——训练运行在完成时从额度余额中扣费。