文章摘要
近期,AI领域专家吴恩达发布深度文章,梳理出打造合格AI应用开发者的六大核心能力框架。他指出AI应用与传统软件有本质差异,开发需反复迭代。六大核心能力包括掌握大语言模型底层逻辑、构建输入数据体系、搭建智能体系统、以评估驱动开发、掌握生产环境运维能力,以及扎实掌握机器学习基础。

近期,AI领域专家吴恩达发布了一篇深度文章,通过调研大量招聘信息、开展专家访谈与问卷调查,系统梳理了打造合格AI应用开发者所需的六大核心能力框架。

这套框架将“做好AI应用开发”拆解为六个核心模块,每个模块都包含丰富的实践细节,绝非简单的目录式分类。

AI应用和传统软件的本质差异

要理解AI应用开发的核心,首先要明确它和传统软件开发的本质区别:传统软件的输入与输出完全确定,比如一个排序函数运行一万次结果都不会变化;但AI应用依赖大语言模型,其输出结果无法提前预知,模型犯错的场景也难以预判,这就要求开发过程必须通过反复迭代推进——先产出一个版本,验证效果后再调整优化。因此,AI工程师的核心能力,本质上是在不确定性中做出精准决策的能力。

第一:掌握大语言模型的底层逻辑

很多使用者仅将LLM当作黑箱,输入问题后等待结果,却无法理解模型答对或答错的原因,这远远不够。开发者需要清晰掌握LLM的工作流程:比如文本如何被切分为token,模型如何逐步生成输出内容,以此判断特定任务是否适合该模型,以及哪些场景下模型更容易出错。

除此之外,还有诸多工程细节需要熟练掌握:比如何时选择多模态模型,如何在有限的上下文窗口中优化内容取舍,缓存机制如何设计,模型的知识截止日期如何影响输出,推理阶段的算力如何管控,以及工具调用的适用场景。更进一步,开发者还需要明确判断:何时需要对模型进行微调,何时适合自行部署开源模型。只有吃透底层逻辑,才能在开发中做出正确的技术选择。

第二:精准构建模型的输入数据体系

大语言模型的输出质量,很大程度上取决于其输入的质量。早期主流的方案是通过向量检索将相关内容注入上下文,也就是RAG技术,但如今这套数据处理方案已经有了更丰富的实践。

开发者需要明确判断:哪些内容应该直接写入提示词,哪些应该让模型在运行时通过工具自行查询。同时还要选择合适的数据组织方式:向量索引、知识图谱、结构化数据上的语义层,分别适配哪些不同的业务场景?不同格式的文档,比如PDF、HTML、图片,应该采用何种处理方式,才能让模型更好地理解内容?

还有一个容易被忽略的关键点:数据质量需要持续维护,不能仅做一次性处理就放任不管。

第三:合理搭建智能体系统

智能体系统的形态差异极大:简单的智能体采用固定工作流,预先设计好一系列LLM调用步骤,按顺序执行即可;复杂的智能体则允许模型自行判断下一步动作,通过循环决策直到完成任务。

开发者需要从多个维度选择合适的方案:哪些步骤可以并行执行,哪些必须串行推进?哪些场景下用代码实现更可靠,哪些场景下用LLM更灵活?当系统出错时如何回退?在工具调用层面,模型可以使用哪些工具、执行哪些命令,都需要提前设计。

另外还要解决记忆管理问题:尤其是在长会话场景中,上下文窗口无法容纳全部历史信息时,该如何处理?何时需要多个智能体协作,而非单一智能体完成全部任务?还有一个常被跳过的重要环节:当原型跑通后,如何将其改造为可投入生产环境的可靠系统?这需要考虑安全边界、对抗性输入防护以及数据泄露防范等风险。

第四:以评估驱动开发,核心分水岭

吴恩达在调研中发现,能够搭建并跑通一套严格的评估闭环,是区分优秀与普通AI工程师的核心关键。很多开发者调整系统全凭主观感觉,觉得哪里有问题就修改哪里,修改后仅凭主观判断认为效果有所提升;而优秀的工程师则会先明确需要衡量的核心指标,搭建一套标准化的评估机制,每次修改后都通过评估数据来决定下一步的优化方向。

评估本身也是一项技术工作:开发者需要分析系统的输出与中间过程,结合业务目标确定合理的衡量指标。评估的形式有多种:比如通过代码编写固定规则进行判断、用LLM自动打分、或者人工审核,每种形式适配的场景各不相同,这同样需要开发者具备判断力。而且评估并非一次性工作,需要随着系统的迭代同步演进优化。

第五:掌握生产环境运维能力

将AI系统从原型开发完成,和将其稳定运行在生产环境中,是完全不同的两件事。AI应用的运维和传统软件运维存在多个关键差异:

首先是观测体系,开发者需要掌握系统在真实用户场景中的实际表现,而非仅依赖测试集的结果。需要监控系统性能,及时发现数据分布的漂移,当模型效果突然变差或遭遇注入攻击时,能够快速响应处理。

其次是测试体系,AI系统的回归测试比传统软件复杂得多:很多任务没有唯一的标准答案,需要通过统计方法判断修改后系统效果是否提升,测试的力度也需要和出错可能带来的代价相匹配。

最后是成本与延迟控制:选择何种模型、是否需要对模型进行蒸馏优化、能否简化工作流等决策,在用户规模扩大后,会直接影响系统能否稳定运营。

第六:扎实掌握机器学习基础

吴恩达指出,所有在LLM应用领域表现出色的工程师,都对机器学习与深度学习有深度的理解。这是因为:大语言模型本身就是机器学习的产物,很多技术判断需要从机器学习的视角才能做出正确选择;同时在很多实际应用场景中,依然需要用到传统机器学习技术,无论是使用第三方预训练模型,还是自行训练模型。

更重要的是,机器学习中的几个核心概念,对AI应用开发极具价值:比如偏差与方差的权衡、错误分析方法、数据工程思维,这些概念能够提供一套系统化的思考框架,帮助开发者在面对输出不确定的AI系统时,做出更合理的决策。

以上内容不代表本平台立场,仅供读者参考