GitHub硬核双响:Karpathy 48美元手搓GPT-2,Perplexity开源查供应链投毒

GitHub硬核双响:Karpathy 48美元手搓GPT-2,Perplexity开源查供应链投毒

GitHub 这周有两个东西值得单独拎出来讲讲,一个是让普通玩家 48 美元手搓一个大模型的 Karpathy 新作,一个是教你自己查电脑里有没有被投毒依赖的 Perplexity 开源工具。一个往「懂」的方向走,一个往「守」的方向走,都挺硬核,也都挺实在。

nanochat:Karpathy 说,48 美元你也能练出 GPT-2

先说 nanochat,作者是 Andrej Karpathy,OpenAI 前成员,搞过 nanoGPT 那位老哥。这个 repo 的定位很直白——「the best ChatGPT that $100 can buy」,开源免费,MIT 协议,目前 57.3k 星。

它其实就是一个人从头到尾、最小可用的 LLM 训练脚手架。从分词、预训练、微调到评测和推理,整条流水线都在一个仓库里,代码刻意写得精简、可读、能随便改。换句话说,它不把你当用户,它把你当「能看懂几行代码的人」。

最有冲击力的是那个数字:2019 年训练一个 GPT-2 花了大概 43,000 美元(当时还是 168 小时的 god 将进度)。而现在用 nanochat,跑 8 张 H100,大约两小时、48 美元就能复现出 GPT-2 级别能力的模型;要是赶在云厂商的竞价实例上薅羊毛,成本能压到 15 美元上下。这背后是整个 7 年技术栈的进步,不是魔法。

他还搞了个「Time-to-GPT-2」排行榜,社区一起比赛谁能最快把一个模型练到 GPT-2 的水平。记录从最初的 168 小时一路卷到现在的 1.65 小时,你甚至能跟这个花了几十美元练出来的模型在命令行里聊天——它真的像个「幼儿园小朋友」,会写诗、会一本正经地胡编。跑起来也不挑,单卡也能练,就是慢 8 倍而已。

想深入拆解大模型到底是怎么长出来的,这个仓库比任何 PPT 都直观。多人协作、改一行重跑对比效果,就是它设计的核心玩法。

Bumblebee:Perplexity 开源了个查「供应链投毒」的扫描器

另一个是 Perplexity 开源工具 Bumblebee,5.0k 星,Apache 2.0。它不是又一个 Agent,而是一把安全应急的冷兵器。

近两年供应链攻击越来越多,问题常常不是「生产环境有没有事」,而是「有没有哪个开发者的笔记本上装了那个被投毒的包」。SBOM 能告诉你发了什么,EDR 能告诉你跑了什么,但真要定位「这台机器上到底哪个锁文件命中了某个 ad-hoc 受害包」,往往还是手工翻。

Bumblebee 干的就是这个:只读扫描你开发机上的 package 锁文件、pip 的 dist-info、Go 模块、Ruby/Composer 锁文件、MCP 配置文件、编辑器插件清单、浏览器扩展和 Homebrew 的安装记录,把散在各处的本机状态整理成带版本的结构化 NDJSON。给你一份已知被投毒版本的目录(threat_intel 目录里有现成的),它就直接报命中,标注严重级别和命中包名版本。

三个扫描档位:baseline 管全局用户级环境,project 扫指定的开发目录,deep 是应急时全盘深扫。天然配合 cron 或 systemd 定时跑,输出是标准 NDJSON,方便接进你自己的告警系统。它是个单文件 Go 二进制,零第三方依赖,也绝不执行任何包管理器命令——只读、不运行,正因为不碰可疑包,出事的时候才敢放心用。

实话

说点实在的。nanochat 那种「48 美元练 GPT-2」的爽点,前提是你有一张算力很够的卡或者舍得租云,纯折腾娱乐没问题,但别指望手搓出来能打现在的商业大模型——它的价值在「看懂」,不在「好用」。Bumblebee 也一样,它是给安全响应和有点动手能力的玩家准备的,你想开箱即用像杀毒软件那样点点点,那还真不是它的路子。

这类东西这两年特别多:越来越多人不再满足于「用黑盒子」,能拆的都想自己拆开看看。想去就去,那是学习曲线最陡、回报也最实在的一条路。

by 数码罗记·godsun.pro

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注