这两年大模型领域最热闹的事情,莫过于价格战了。
从2023年开始,各大厂商不断下调大模型API的价格,到了2025年,调用大模型的成本已经降到了几年前的几十分之一。以前调用一次GPT-4可能要几块钱,现在很多国产大模型,调用一次只要几分钱甚至几厘钱。
价格战带来的直接影响是,大模型的使用门槛大大降低了。以前只有大公司才用得起的技术,现在个人开发者和小团队也能随便用了。这对学习者来说是个好消息,因为你可以用很低的成本,去尝试各种大模型应用。
我是从2024年开始系统学习大模型技术的。在这之前,我只是一个普通的后端开发者,对AI的了解停留在"听说过"的层面。经过一年多的学习和实践,我现在已经能独立开发大模型应用了。
这篇文章我想分享一下我的学习路线,以及在价格战背景下,如何低成本、高效率地入门大模型技术。如果你也想学习大模型,但不知道从哪里开始,希望这篇文章能给你一些参考。
为什么要在价格战时期学习大模型
先说说为什么我觉得现在是学习大模型的好时机。
第一个原因是成本低。
大模型价格战之前,学习大模型的成本很高。你要么自己买显卡训练模型,动辄几万几十万;要么调用昂贵的API,做个实验可能就要花几百块。很多人因为成本太高,望而却步。
现在不一样了。很多国产大模型的API价格非常便宜,做实验、做项目,一个月可能也就花几十块钱。甚至有些厂商提供免费额度,个人学习完全够用。低成本意味着你可以大胆尝试,不用担心花太多钱。
第二个原因是资料多。
大模型火了之后,各种学习资料层出不穷。官方文档、技术博客、视频教程、开源项目、书籍,应有尽有。而且很多资料都是免费的,只要你愿意学,不愁找不到资料。
第三个原因是需求大。
现在几乎所有行业都在探索大模型的应用,市场对大模型人才的需求很大。学会大模型技术,不管是找工作还是做副业,都有很多机会。
所以,现在这个时期,成本低、资料多、需求大,是学习大模型的黄金时期。
第一阶段:打好基础
我的学习路线分为几个阶段,第一个阶段是打好基础。
刚开始学习大模型的时候,我犯了一个错误:一上来就想做复杂的应用,结果发现很多基础概念都不懂,越学越迷茫。后来我调整了策略,先花时间打基础。
基础阶段主要学三个方面的内容。
第一个方面是大模型的基本概念。
你需要了解什么是大模型,它的基本原理是什么,Transformer架构是怎么回事,注意力机制是什么,预训练和微调有什么区别,提示词工程是什么,RAG是什么,Agent是什么。这些概念是大模型的基础,不懂这些,后面的学习会很困难。
学习这些概念,我推荐先看一些科普性的文章和视频,建立一个整体的认知。然后再看一些技术文档和论文,深入理解细节。不需要一开始就把所有东西都搞懂,先有个大概的印象,后面在实践中慢慢理解。
第二个方面是Python编程基础。
大模型的开发主要用Python,所以你需要有一定的Python基础。如果你之前没学过Python,建议先花一两周时间学一下Python的基本语法,以及常用的库,比如requests、numpy、pandas等。
不需要成为Python专家,能看懂代码、能写简单的脚本就行。后面在项目中遇到不懂的,再边查边学。
第三个方面是API调用基础。
大模型的应用,很多都是通过API调用实现的。所以你需要学会如何调用大模型API。找一个便宜的国产大模型,注册账号,获取API Key,然后写一个最简单的脚本,调用API,让大模型回答一个问题。
这一步看起来简单,但很重要。它能让你快速建立对大模型的直观感受,知道大模型能做什么,不能做什么。
基础阶段我花了大概一个月的时间。这个阶段不要急着做项目,先把基础打牢,后面的学习会顺利很多。
第二阶段:提示词工程
打好基础之后,第二个阶段是学习提示词工程。
提示词工程是大模型应用开发中最基础也最重要的技能。同样的大模型,不同的提示词,效果可能天差地别。学会写好提示词,能让你用最低的成本,获得最好的效果。
提示词工程的学习,我主要是通过实践来学的。
我找了一个具体的场景,比如写文章摘要,然后尝试用不同的提示词,看哪种效果最好。我会对比不同提示词的输出结果,分析为什么有的好有的差,然后总结规律。
在这个过程中,我学到了很多提示词的技巧。比如,提示词要明确具体,不要模糊;要给大模型设定角色,比如"你是一个专业的编辑";要给出示例,让大模型知道你想要什么样的输出;要分步骤指导,复杂的任务拆成多个步骤。
我还学习了一些高级的提示词技术,比如思维链、少样本学习、自我一致性等。这些技术能显著提升大模型在复杂任务上的表现。
提示词工程的学习,不需要看太多理论,最重要的是多实践。多写、多试、多对比,慢慢就有感觉了。
这个阶段我也花了大概一个月的时间。现在回想起来,这个阶段的投入非常值得,因为提示词能力是大模型开发的基本功,后面做项目天天都要用。
第三阶段:RAG实战
第三个阶段是学习RAG,也就是检索增强生成。
RAG是目前大模型应用最广泛的技术之一。它的基本思路是,先从知识库中检索相关的文档,然后把检索到的文档和问题一起传给大模型,让大模型基于检索到的内容来回答问题。
RAG能解决大模型的两个核心问题:一是知识过时,二是幻觉。通过RAG,大模型可以基于最新的、特定的知识库来回答问题,而且回答有依据,不容易胡说八道。
学习RAG,我是从一个简单的项目开始的。我做了一个个人知识库问答系统,把我自己的笔记和文章导入进去,然后可以用自然语言提问,系统会基于我的笔记来回答。
做这个项目的过程中,我学习了RAG的完整流程:文档加载、文档分割、向量化、向量存储、检索、重排序、生成回答。每个环节我都尝试了不同的方案,对比效果。
比如文档分割,我试过按固定长度分割、按语义分割、按标题分割,最后发现按标题结合固定长度的效果最好。比如向量化,我试过不同的嵌入模型,发现国产的一些嵌入模型效果不错,而且价格便宜。
通过这个项目,我对RAG有了深入的理解。后来我又做了几个RAG相关的项目,比如客服问答系统、文档摘要系统,越来越熟练。
RAG这个阶段,我建议一定要动手做项目。光看教程是学不会的,只有自己动手做一遍,遇到问题、解决问题,才能真正掌握。
第四阶段:Agent开发
第四个阶段是学习Agent开发。
Agent是大模型应用的进阶方向。简单来说,Agent就是让大模型不仅能回答问题,还能使用工具、执行任务、自主决策。比如,一个Agent可以帮你搜索资料、整理数据、写报告、发邮件,全程自动化。
学习Agent,我是从LangChain这个框架开始的。LangChain是目前最流行的大模型应用开发框架,它提供了很多Agent相关的组件,比如工具调用、记忆、规划等。
我先跟着官方教程,做了一个简单的Agent,能调用搜索工具回答问题。然后慢慢增加复杂度,比如让Agent能调用多个工具,能记住对话历史,能处理多步骤任务。
在这个过程中,我遇到了很多问题。比如Agent经常走错步骤,或者调用工具的参数不对,或者陷入死循环。解决这些问题的过程,让我对Agent的原理和局限性有了深入的理解。
我还学习了Agent的一些高级技巧,比如规划与执行、反思与修正、多Agent协作等。这些技术能让Agent处理更复杂的任务。
Agent这个阶段比较难,需要有耐心。我花了大概两个月的时间,才觉得自己入门了。但Agent的潜力很大,学会之后能做很多有意思的应用。
第五阶段:微调与部署
第五个阶段是学习模型微调和部署。
前面几个阶段,都是基于现成的大模型API来做应用。但有时候,API不能满足需求,比如需要定制化的模型,或者需要私有化部署。这时候就需要自己微调模型,或者部署开源模型。
微调方面,我学习了LoRA和QLoRA这两种高效微调方法。它们可以在单张消费级显卡上,对大模型进行微调,成本很低。我用自己的数据集,微调了一个7B的模型,效果还不错。
部署方面,我学习了vLLM和Ollama这两个部署工具。vLLM适合生产环境部署,吞吐量高;Ollama适合本地开发和测试,简单方便。我用Ollama在本地部署了几个开源模型,做了一些实验。
这个阶段需要一定的硬件条件,最好有一张显存比较大的显卡。如果没有显卡,也可以用云服务器,按小时计费,成本也不高。
微调与部署不是必须的,如果你的需求用API就能满足,不学这个也没关系。但了解一下,能拓宽你的技术视野。
价格战时期的省钱技巧
在价格战时期学习大模型,有一些省钱的技巧。
第一个技巧是选择便宜的国产大模型。
现在很多国产大模型的API价格非常便宜,而且效果也不错。学习和做实验的时候,优先用这些便宜的模型,能省很多钱。等项目成熟了,再考虑要不要用更贵的模型。
第二个技巧是利用免费额度。
很多大模型厂商都提供免费额度,新用户注册会送一些额度,有些厂商还有长期的免费套餐。学习的时候,充分利用这些免费额度,基本上不用花钱。
第三个技巧是用小模型做实验。
大模型的价格和参数规模有关,参数越大越贵。做实验的时候,可以先用小模型快速验证思路,等思路验证好了,再用大模型做最终版本。这样能省很多钱。
第四个技巧是缓存和批处理。
如果有重复的请求,可以缓存结果,避免重复调用。如果有大量的请求,可以批量处理,提高效率,降低成本。
第五个技巧是用开源模型本地跑。
如果你的电脑有显卡,可以用Ollama在本地跑开源模型,完全免费。虽然效果可能不如商业模型,但学习和做实验完全够用。
学习资源推荐
最后推荐一些我觉得不错的学习资源。
书籍方面,推荐《大模型应用开发实战》和《LangChain实战》,这两本书比较实用,适合入门。
网站方面,推荐Hugging Face的课程,免费而且质量高;还有LangChain的官方文档,写得很详细。
视频方面,B站上有很多大模型相关的教程,搜一下就能找到。推荐一些做AI教程的UP主,他们的视频通俗易懂,适合入门。
开源项目方面,推荐LangChain、LlamaIndex、AutoGPT等,看这些项目的源码,能学到很多东西。
社区方面,推荐加入一些大模型相关的微信群、QQ群、Discord社区,和大家交流学习,能少走很多弯路。
写在最后
大模型价格战,降低了技术的门槛,也给了我们普通人学习和使用大模型的机会。
我的学习路线是:打基础、学提示词、做RAG项目、开发Agent、学微调和部署。这个路线不一定适合所有人,但可以作为参考。
最重要的不是路线,而是行动。不要等到"准备好"了再开始,边学边做,在实践中成长。大模型技术发展很快,今天学的东西明天可能就过时了,但学习能力和实践经验,是永远不会过时的。
最后用一句话来结束这篇文章:"最好的学习时间是十年前,其次是现在。"
愿你在大模型的浪潮中,找到自己的方向,学有所成。
评论(0)
暂无评论,快来抢沙发~
评论功能仅对会员开放,请先登录
登录