
过去一年,AI 应用的开发门槛被迅速压低:过去需要几十名工程师和产品经理、耗时数个季度才能完成的产品,如今一个人借助 AI,几周内就能做出原型。应用更容易被创造,也更容易被复制。当界面、功能甚至工作流都不再构成稳固壁垒,AI 公司真正需要回答的问题变成了:除了调用同一批基础模型,自己究竟还拥有什么?
Fireworks AI CEO 兼联合创始人 Lin Qiao 给出的答案是,拥有自己的智能。Lin Qiao 曾长期参与 PyTorch及 Meta AI 基础设施建设,如今创办的 Fireworks AI 为 Cursor、Doximity、Factory 等公司提供模型训练与推理基础设施。
在她看来,后训练并不是模型团队专属的技术游戏,而是 AI 产品在找到 PMF、开始规模化之后,几乎绕不开的一门必修课。它既决定一家公司能否把对用户的理解沉淀为模型能力,也决定业务能否摆脱昂贵的通用模型,建立真正可持续的成本结构。
她在红杉的分享中提出了几个核心判断:
1. AI 应用的壁垒正在从“做出产品”转向“拥有自己的智能”。 当任何人都能快速复刻界面和功能,真正难以复制的,是一家公司对客户的理解、判断与品味,以及这些知识能否被写进模型。
2. 后训练不是起点,而是产品找到 PMF 之后的下一步。 早期团队应优先使用前沿模型验证需求;只有产品获得真实使用和稳定反馈,积累的数据才足以支撑后训练。
3. 后训练不是单一技术,而是一条逐级深入的路线。 从提示词、RAG,到监督微调、偏好优化,再到强化学习和蒸馏,每种方法解决的问题不同,团队不应一开始就盲目追求复杂训练。
4. 数据的质量比数量更重要,产品团队必须进入训练闭环。 最了解什么是“好结果”的往往不是研究人员,而是最懂用户的产品团队。后训练正在打破产品、研究和机器学习团队之间原有的边界。
5. 评估体系才是后训练真正的地基。 创始人的“感觉不错”需要被转化为可重复的评分标准和测试体系;否则,无论投入多少数据和算力,都难以判断模型是否真的变好。
6. 强化学习最难的不是训练,而是定义正确的奖励。 如果奖励函数不能准确反映真实目标,模型就可能通过“奖励黑客”完成指标,却交付一个完全错误的结果。
7. 模型效果必须由真实产品指标裁决。 训练完成并不意味着实验结束,模型还需要进入服务环境接受 A/B 测试;训练与推理栈不一致,甚至可能让训练阶段获得的能力在上线时损失。
8. 后训练同时解决差异化和成本问题。 它既能把企业独有的数据、经验和品味编码进模型,也可能将推理成本降低至原来的五分之一到十分之一,使AI产品在扩大流量时不至于被模型成本拖垮。
9. 未来不会只有少数几个通用大模型,而可能出现数百万个专业模型。 法律、医疗、金融、招聘、销售和客户支持等领域,都将产生围绕具体任务训练、承载特定专业知识的专属智能。

为什么后训练是你绕不开的必修课
Sonya Huang(Sequoia Capital合伙人):先做个现场调查,在座的各位,谁在做后训练?人数不少。那谁在用Fireworks?也有很多人。Lin,你在观众席里有些朋友吧?那么对于接下来的这个演讲,我们要做的是,重点讨论后训练。Lin,这个演讲的设置和Brendan的类似。我们会用15分钟来讲解如何着手解决后训练的问题,然后大概15分钟进行问答环节。Lin,非常高兴你能来这里。感谢你加入我们。
Lin Qiao(Fireworks AI CEO 兼联合创始人):谢谢邀请。大家早上好。我是Lin,Fireworks的CEO兼联合创始人。那么,在我们展示今天的幻灯片时,我将稍微深入探讨一下后训练,以及为什么后训练对于你们构建自己的业务可能非常相关。首先,简单介绍一下背景。今年我们——首先,在Fireworks,我们有一个专门的智能平台。我们上面构建了非常非常多的应用,从初创公司到数字原生企业都有。所以,我工作中比较有趣的部分是,我们能看到很多模式——人们在我们的平台上构建什么创新,他们面临什么挑战,以及趋势是什么。
作为开发者,人们在我们的平台上构建应用。其中一件事,特别是在过去一年里,软件开发和应用程序开发在某种程度上已经被颠覆了。因为过去,你有一个好主意想要实施并扩展到生产环境,需要一个由数十名非常强大的工程师、产品经理组成的团队,花好几个季度合作才能交付。而现在,一个人,几周时间,甚至不需要知道如何写一行代码,你就能做到。
这种在时间线和深度专业知识两方面所需资源的压缩,正在改变应用领域的竞争格局。它正促使人们从考虑在现成的、封闭的API之上构建,转向构建更深的模式,以便他们能建立一个更持久的业务。同时,你也看到了很多讨论,特别是在过去一周,关于开放模型和封闭模型之间的讨论,以及对开放模型的所有支持和集结。这种联盟的深度,是因为我们相信——整个行业——要深得多,因为看看整个行业,有这么多的公司。
你们所有人都在创建自己的公司。每个公司的存在都有其原因,因为它们专注于以特殊的方式解决一个独特的问题。这意味着他们将自身的判断、品味、决心和信念融入到产品中。这就是我们公司今天存在的原因。如果你是在现成的API之上构建,那么你真的需要思考如何保持这种特殊的品味、判断和独特之处向前发展。我们相信,每家公司建立持久业务的一种方式,实际上是把你对客户的判断、品味和深刻理解,融入到你所构建的智能中,而不仅仅是使用一个现成的API。这就是关于行业现状、我们观察到的情况以及为什么后训练可能与你们非常相关的一些背景。

图片来源:Sequoia Capital

从提示词到强化学习,你的进阶路线图
你可能听过很多关于”拥有自己的智能,而不是租赁”的说法。那么”拥有自己的智能”到底意味着什么?实际上它意味着很多事情。首先,从数据开始。智能是数据的衍生物,前沿实验室,我们使用的所有基础模型,都是建立在公共数据和标注数据之上的,这些数据解决的是通用任务。但你们所有人都在解决一个特定的任务,这就是为什么你们在创建业务、创建公司。
能够策划具有高质量的生产数据,甚至生成数据来丰富你的生产数据,是拥有自己智能的第一步。在你有了数据之后,你将开始利用这些数据,在现有模型的基础上构建模型,并拥有模型权重。有一系列技术可以用来达成目标,这些技术针对你可能遇到的不同类型问题而定制,这些技术也可以相互配合,帮助你达到最终目标。
在你拥有了一个属于自己的、能很好解决你特定问题的优秀模型之后,你需要考虑如何服务它。你可能首先会做一些A/B测试,以确保它确实能推动你的产品指标。然后,再回到这个循环中。
你不应该立刻跳入后训练。你会经历不同的阶段。首先从提示词开始,每个人都从提示词开始,使用模型原样,少样本学习,如果你能快速用这个来测试你的想法。然后你使用RAG,将AI的应用扎根于你自己的数据,你可以开始从那里做很多上下文工程。这些是从几分钟到几小时的交互。
然后你首先进入”嘿,我有一些数据,我想看看我的数据如何反映出来,让模型在我的产品中工作得更好”的阶段。所以你会开始进行监督微调,这会花费你几个小时。然后,到了”嘿,我希望模型能反映个性化的品味。这是我产品非常独特的选择”的阶段。因此,你会想要开始使用从用户交互中收集的偏好信息,比如点赞、点踩等等,帮助模型学习你产品的品味。
最后,你想要构建一个能够理解并承载你在该领域专业知识的模型,无论那专业知识是法律、金融、医疗、客户支持、招聘、市场营销、销售。即使在一个行业垂直领域内,也有如此多的子领域。所有这些对于你所构建的产品来说都是独特和特殊的。通常,你可能听说过很多关于强化学习的内容,这正是用来构建专业化的工具。
这个进阶过程与我们人类随时间学习知识的方式非常相似。例如,我们实际上通过阅读文献学到了很多知识,文献会告诉你什么是对的,什么是错的。这非常类似于监督微调。随着我们成长,我们发展出自己的品味和判断,关于我们如何以特定的方式处理问题,这就是偏好或DPO。而随着时间的推移,我们学会了在某个领域做得非常好,比如”嘿,我想成为一名会计师,我真的知道如何处理财务数据”,或者”我想成为一名牙医,你学习操作牙科的具体细节”。所有这些都非常类似于我们人类获取知识的方式。
非常有趣的是,不同的技术用于解决不同种类的问题。例如,如果模型不知道某个事实,而事实是非常动态的,你产品中的数据事实非常动态,那么通常会使用RAG来解决这个问题。然而,如果你的模型输出或行为或结构有问题,那么你就策划数据并进行监督微调来纠正它。如果你的模型回答的质量是个人化的,或者特定于你产品的品味,那么你就使用偏好调优。如果模型在你试图解决的特定问题上相当薄弱,那么你就使用强化学习。
而最终,如果模型对于生产环境来说太慢或太昂贵,那么你就使用蒸馏,让老师模型教一个更小的学生模型,使其性能更好或更经济。蒸馏对于LLM、VLM或图像生成模型也意味着不同的东西。如果你们感兴趣,我们可以更多讨论。

图片来源;Sequoia Capital

别踩这些坑——数据、评估、奖励黑客与训练推理对齐
有很多不同的方式,团队开始尝试这些技术,他们可能对体验不满意,因为他们可能烧钱和时间,但可能达不到理想的结果。这里有一些你可能感到沮丧的地方。例如,当涉及到数据时,数据是调优的本质,数量不是最重要的,质量才是最重要的。但有时候,仅仅向训练过程投入大量数据并不一定能带来好的结果。你真的需要控制数据质量。通常,谁是对数据质量最好的评判者?实际上是你的产品团队。
这就是我们看到的变化,在生成式AI之前,产品团队和研究团队或机器学习团队是分开的组织,他们是独立的团队,他们携手合作来完成任务。而现在很多情况下,当人们后训练生成式AI模型时,我们看到产品团队需要对其数据质量做出判断,并开始深入参与这个过程,以确保最佳结果。
第二是你要有评估体系。我知道你们都很忙,急于推出产品,很多评估是”凭感觉评估”,创始人直接看结果,感觉”嘿,这是对的还是不对的?”实际上,这是你将自己的判断应用于最终结果,并决定它是否良好。这种判断会转化为系统性的评估。这与传统软件开发没什么不同,你有单元测试、集成测试来保证质量。同样,如果你想做后训练,拥有一种方法来构建评估体系,并将你的判断融入可重复的过程中,是极其重要的。
然后,当你做强化学习时,可能会有马虎的强化学习环境,你构建了一个模拟,但模拟并没有真正反映现实,那么模型可能会利用糟糕的模拟进行”奖励黑客”。关于奖励黑客的一个有趣故事是,我们曾要求一个模型生成代码,以最小化编译错误。猜猜模型做了什么?模型生成了零行代码。没有编译错误,但这绝对不是你想要的。所以这是黑客行为的一个例子,很常见,因为模型非常聪明。它会尝试各种不同的方式来达到你的目标,但这可能不是你想要的。所以要注意所有这些细节,尽量不要让模型比你更聪明。
在你的实验过程中,把你的开发过程看作是做大量的实验,从训练模型到——训练模型并不是你实验的终点。最终的评判者是产品指标是否在移动。所以你需要将最终模型带入服务层并进行A/B测试。这个过渡极其重要,因为如果你在不对齐这两个堆栈的情况下,从一个训练堆栈迁移到一个服务堆栈,质量可能会下降。
想想看,模型是大量的计算、数学和矩阵乘法。进行矩阵乘法和计算的方式,如果你使用不同的库、不同的数值计算和不同的优化,会导致不同的结果。因此,训练的结果可能无法复制,甚至在服务过程中丢失精度。所以这种对齐非常重要。我可以给你更多例子。还有其他一些挑战你会遇到,很高兴在之后线下和你们详细讨论。

他们已经跑通了——Cursor到医疗、安全、协同办公的真实案例
有很多先驱者与我们合作进行后训练。Cursor是其中最早的一批,他们从去年年初就开始踏上这条道路。原因有很多。一是他们真的想控制模型供应的命运,显然他们有很多用户互动,他们理解客户的偏好,拥有大量数据。这成为他们旅程的起点,他们做了相当深入的中间训练到后训练,你们也听到他们每隔几个月就发布更新的模型,结果很棒。他们的志向是竞争前沿质量,非常大胆的抱负,他们正在接近目标。Composer 2、Composer 2.5的结果令人印象深刻,在质量上总是力求与前沿实验室持平或超越。所以他们是其中一个例子,一个非常有活力的例子,表明只要你保持专注并拥有合适的工具,这完全是可行的。Cursor就是构建在我们之上的。
还有大量的其他例子,例如在医疗保健领域,Doximity就是一个例子,他们做临床AI,让医生提出深入的医学问题,将症状与药物和副作用匹配,进行关于医疗领域各方面的全面深入研究。他们实际上也在Fireworks上进行训练,并且在一个非常重要的医疗安全基准上取得了顶尖成绩,我们为此感到非常自豪。他们持续在进行后训练循环。
Factory是另一家Squa公司,他们在Fireworks之上构建,特别关注编码中的安全部分。这是一个非常困难的课题,因为安全不容出错,你必须做对。他们调整的模型也在安全领域的基准测试中排名顶尖。所以你可以看到所有这些例子都证明,这些公司都以特殊的方式解决非常独特的问题,并且他们能够通过基于开放模型构建,利用自己的数据来构建自己的智能。
这些是细节。如你所知,去年2025年是编码之年,在Fireworks,我们支持所有构建在我们之上的编码公司,在中间训练到后训练方面取得了很多成功,产生了非常强大的模型。正如你们所看到的,这些基准测试结果令人印象深刻,所有这些编码公司都渴望在编码领域达到或超越前沿实验室的水平。
但不仅仅是编码,今年我们开始在各种不同类型的”协同工作”领域看到非常有趣的发展,从通用协同工作到特定领域协同工作,正如我提到的,有法律、金融、市场营销、招聘、销售、客户支持等领域的协同工作开始进行后训练,并拥有自己的智能来驱动他们的产品。
这里,Jensen Spark是通用协同工作应用之一,他们为专业人士构建深度研究和幻灯片生成。他们与前沿模型竞争,稍微好一点,但成本显著降低。这里我们说的是降低5到10倍的成本。所以,作为一个初创公司,一旦你找到了产品市场契合点,你就可以快速扩展,成为一个持久的业务。Hide是另一个医疗保健例子,医疗保健数据或用例并没有被前沿实验室模型完全覆盖。所以你可以看到,经过调优的模型质量显著优于最先进的封闭模型。
我们有不同类型的开发者在Fireworks之上进行后训练。那么这些类型是什么?我们看到很多前沿智能体构建者。前沿智能体构建者通常构建定制的、专门化的训练框架。他们不使用通用的框架,而是为了将他们的框架与他们的系统和各种工具进行协同优化,这通常需要后训练。我们已经看到很多可重复的成功案例。
我们也看到很多大公司进行后训练,因为有趣的是,这些现有企业拥有巨大的流量,对他们来说,在所有客户中部署AI功能是一项巨大的成本负担。所以,如果我们说”需要小心,不要规模扩张导致破产”,这不仅适用于初创公司,实际上也适用于现有企业。他们的CFO确实会因为成本而阻止AI功能的发布,而后训练是解决这个问题的途径。我们也看到很多专业化的模型运营者,这些可能是新的实验室和许多前沿模型开发者,他们也进行大量的后训练。

什么时候上车?怎么上车?
我们反复强调,在产品找到市场契合点之后,后训练正在成为许多公司构建专业化智能的主流路径。我们坚信,也正在见证这一趋势——未来可能会有数百万个专业化模型诞生,每个应用、每个用例都可能拥有自己的专属模型。同时,我们也看到,将数据转化为模型能力的方式多种多样,而奖励信号的设计及其函数构建,则是其中非常关键的一环。我们的建议是:尽早开始,多轮迭代实验,尽快积累实践经验。实际上,这个领域的入门门槛并没有想象中那么高,因为奖励工程的逻辑和思维方式与软件工程高度相似。所以,不妨动手尝试起来。
当然,我们也意识到,不同团队在专业背景和需求上存在差异。例如,与Cursor、Cognition这类公司合作时,他们拥有深厚的研究团队,希望尽可能精细地控制每一个参数以获得极致效果。因此,我们为他们提供最底层的API,包括强化学习回滚等能力,让他们可以直接交互并完全掌控训练器,从而取得最佳结果。
而更多团队拥有的是产品工程师或机器学习工程师背景,他们对后训练已有足够认知,希望拥有一定控制权,但未必需要触及最底层。因此,我们提供了训练SDK,方便与大家紧密协作,帮助你们快速上手。同时,我们也可以派出自己的研究人员,为团队提供手把手的入门培训。这些都是我们根据不同客户需求,提供的差异化支持方式。我先讲到这里,欢迎大家提问。
提问者(观众):人们最成功的案例是,他们已经拥有数据和奖励信号,也许来自我们的产品。你见过的最好的奖励信号例子是什么?人们非常成功地快速训练了模型。

图片来源:Sequoia Capital
Lin Qiao:通常来说,你可以把奖励机制理解为代码形式的评分标准,它需要在多个维度上对结果进行衡量。比如,如果你在构建一个招聘智能体,就可以思考“我们如何评估候选人筛选的质量”。不同的公司,标准一定各不相同。举例来说,我们想评估候选人的能力:他们是否真的积极主动?是否不轻易接受“不”作为答案?他们能否打破障碍?这是其中一个维度。第二个维度是,他们在构建事物和推进进度方面是否足够迅速。接下来,你会有一个分数组合来整合这些维度。因此,可以把奖励看作是评分标准的不同维度,而不同公司融合这些标准的方式,正是他们的独特之处和竞争秘诀。
提问者(Traversal的Ras):Lin,演讲很精彩。我是来自Traversal的Ras。我有个问题。你刚才提到过早进入后训练可能带来一些陷阱,但从Cursor、Cognition等公司的实践来看,他们一般是在什么节点开始考虑后训练的?是当团队感觉到“准备好了”的时候,还是当成本压力变得明显的时候?比如,有些基准测试显示他们正在逐渐超越前沿模型,这也许是一个信号——但这真的是核心驱动力吗?为了那2%的性能提升,投入整个后训练框架的成本和长期维护,值得吗?封闭模型虽然贵,但后训练也有启动成本、人力和持续维护支出。所以我很好奇,他们是到了成本成为瓶颈的时候才开始行动,还是提前一两年就开始规划,以应对未来的用量激增?
Lin Qiao:这是个很好的问题。通常,我们会把AI产品构建中的“产品市场契合度”和“业务规模化”视为两个不同的阶段。过去我们常说,一旦你找到了产品市场契合,就可以毫无保留地快速扩张。但现在我们看到,产品市场契合本身并不保证业务能持续健康发展。许多公司采取的实际策略是:在第一阶段,优先使用前沿实验室提供的大模型来验证产品市场契合度,这样可以专注于业务本身,把成本和工程复杂性降到最低。
另一个关键点是,只有当你真正达到了产品市场契合,从产品使用中收集到的数据才具有实质意义,同时你也会开始积累高质量、大规模的业务数据,而这些数据恰恰是打造自有智能系统的基础。
因此,我们观察到一个明显的信号:一旦产品市场契合确立,企业就会真正考虑如何扩展业务,这时两个核心问题就会浮现:第一,如何保持竞争优势;第二,如何建立一个健康的商业模式,使收入与成本相匹配。正是在这个节点,后训练成为一个极具吸引力的选项。
原因有两方面。第一,后训练可以帮助你将自身独特的业务理解和“品味”直接编码进模型,这种差异性很难被竞争对手复制——因为应用程序本身极易被模仿,你甚至可以从一张截图生成相似甚至更好的应用,这在一定程度上削弱了应用层的壁垒。而将反映产品参与度和深度运营知识的数据融入到模型中,恰恰是保留和强化价值的关键方式。
第二,经过后训练的模型,可以将推理成本降低5到10倍。这意味着在同样预算下,你可以支撑5到10倍的流量,规模效应显著增强,也避免了因扩张而导致成本失控的问题。因此,我们认为,这两个因素构成了企业为何以及何时启动后训练的核心叙事和决策逻辑。
Sonya Huang(Sequoia Capital合伙人):谢谢Lin。感谢大家。
原视频:Post-Training Is How You Keep Your Taste | Fireworks CEO Lin Qiao
https://www.youtube.com/watch?v=yAvJ7b_FxUA
编译:Ruby Gao
本文由作者@Z Finance,授权发布于平台,未经许可禁止转载。

