聊聊小公司如何做大模型-电子发烧友网

在小公司做大模型，这个事情是可以的。

笔者在小公司，做了一年多的大模型。先列一下成绩单：

开源了目前业界可能是分类较完整（50类）、数量较大（1100+万）的SFT数据集：匠数科技大模型sft数据集[1]

通过SFT、DPO、RLHF等技术训练了领域写作模型。实测下来，在该领域写作上，强于国内大多数的闭源模型。

如何在小公司做大模型，笔者总结，有如下几点：

1、至少要有基础的硬件条件。

如果双卡3090都没有，那是比较难的。实在没有，可以说服老板，租机器训练。

2、要有选择跟进模型训练、部署的最新进展，选主流、走大道。

技术迭代太快，人力有限的情况下，不可能什么都跟进的。比如部署，市面上的部署方案很多了，但是主流的就是vllm，所以，集中精力将vllm搞懂用好，就够了，其他的可以了解，但不用重点关注。

再比如各种训练技术，经过验证好用的也就是那么几个。看起来过于旁门左道的论文，可以先放放，让子弹飞一会儿再说。提一点，DPO确实是小公司对齐训练的福音。

3、要坚持开放交流，多加群。

围绕llm，有很多社群，也有很多活动，可以选择性参加，但是切记切记，不要过分沉溺其中，以为这样就能紧跟时代前沿，掌握最新趋势了。假装学到很多，是很有害滴。记得前段时间不是有个什么架构，号称取代transformer吗？铺天盖地的宣传，笔者当时也听了作者的线上分享。现在呢？自己连个像样的模型都没搞出来。纯纯浪费太多精力。相信时间会证明一切。

4、要针对业务场景解决问题，不要陷入llm崇拜。

这种现象典型的就是不是llm的工作就提不起神，不想做。实话实说，这是病，得治。笔者根据业务问题需求，开源的cutword[2]，就是为了替代jieba的新一代分词工具，同时，ner类型和效果都是目前开源中一流的，也收获了大家的认可。

解决问题才是关键。不能有了llm这个锤子，看什么都是钉子。具体问题具体分析的能力很重要。

审核编辑：黄飞

声明：本文内容及配图由入驻作者撰写或者入驻合作网站授权转载。文章观点仅代表作者本人，不代表电子发烧友网立场。文章及其配图仅供工程师学习之用，如有内容侵权或者其他违规问题，请联系本站处理。举报投诉

大模型

大模型

+关注

关注
2

文章
2543

浏览量
3119

原文标题：如何在小公司做大模型

文章出处：【微信号：zenRRan，微信公众号：深度学习自然语言处理】欢迎添加关注！文章转载请注明出处。

林超文PCB设计：PADS教程，PADS视频教程	郑振宇老师：Altium Designer教程，Altium Designer视频教程
张飞实战电子视频教程	朱有鹏老师：海思HI3518e教程，HI3518e视频教程
李增老师：信号完整性教程，高速电路仿真教程	华为鸿蒙系统教程，HarmonyOS视频教程
赛盛：EMC设计教程，EMC视频教程	杜洋老师：STM32教程，STM32视频教程
唐佐林：c语言基础教程，c语言基础视频教程	张飞：BUCK电源教程，BUCK电源视频教程
正点原子：FPGA教程，FPGA视频教程	韦东山老师：嵌入式教程，嵌入式视频教程
张先凤老师：C语言基础视频教程	许孝刚老师：Modbus通讯视频教程
王振涛老师：NB-IoT开发视频教程	Mill老师：FPGA教程，Zynq视频教程
C语言视频教程	RK3566芯片资料合集
朱有鹏老师：U-Boot源码分析视频教程	开源硬件专题

搜索历史

聊聊小公司如何做大模型

评论

中国2家AI公司连发新模型赶超OpenAI

SAR ADC如何做好布线布局？

聊聊std::move函数和std::forward函数

华秋商城器件做EDA封装

从“可用”到“好用”，百度智能云如何做大模型的“超级工厂”？

用LM3886T做大功率输出时，发现输出信号的波形不平滑，为什么？

新火种AI 大模型公司纷纷被收编！创始人们逐渐变成了“最讨厌的自己”？

Hugging Face科技公司推出SmolLM系列语言模型

如何做好大功率环形电感选型工作

潞晨训推一体机，画出大模型到企业的一条龙路线图

【大语言模型：原理与工程实践】大语言模型的基础技术

ASML任命新CEO，带领公司走向未来

STM32扩展IO口如何做？

sora模型中国可以使用吗 sora模型是哪个公司

sora模型上市公司 sora模型对现实的影响