AI前沿速递|Strix 50K星AI黑客自动渗透、taste-skill 74K星专治AI丑UI、百度Unlimited-OCR一口气拆完PDF、MiniMax-H3有声视频生成
今晚这波 GitHub 有点意思,四个项目四个方向:安全、设计、文档、视频,没有一个是重复前几期的老面孔。按惯例先说结论——最让我兴奋的是 Strix,最让我想吐槽的是 AI 审美这件事,最实用的是百度的 OCR,最「哇」的是 MiniMax 的 H3。一个个来。
1. usestrix/strix — ⭐50.3K,让AI黑客团队替你打工
Strix 是个开源的 AI 渗透测试工具,说白了就是一群「AI 黑客」自动跑你的代码、找漏洞、还真的把漏洞利用出来给你看。跟传统扫描器最大的区别是:它不是靠特征库猜,而是真的把 PoC(概念验证)跑通,所以基本没有传统扫描器那种满屏误报的毛病。
- 内置完整渗透工具箱:侦察、利用、验证一条龙,开箱即用
- 多 Agent 协同:一组 AI 渗透测试员并行干活,还能互相配合
- 真漏洞验证:给出能跑通的 PoC,而不是一堆假阳性
- 自动修复建议 + 合规报告:扫完直接生成 patch 和报告
- 能接 CI/CD:每次 PR 自动扫一遍,烂代码进不了生产
- Apache-2.0,Python 写的,pip 装就行
上手:装个 Docker、配一个 LLM API key(OpenAI/Anthropic/Google 都行),然后一条命令开扫,结果存到 strix_runs/。
实话: 我没拿它真去扫过什么目标——这玩意儿是主动攻击型的,只能扫你自己有书面授权的系统,乱扫违法,别作死。适合安全团队、想认真搞 bug bounty 的人,以及那些被安全测试排期拖了三个月的大厂开发者。想尝鲜的小白建议先拿 CTF 靶场练手。
2. Leonxlnx/taste-skill — ⭐74.6K,给AI装上「审美」
74K 星,这增长速度说明大家都被 AI 生成的丑界面恶心坏了。taste-skill 是一套 Agent Skills,专门治 AI 做前端时那股「模板味」——就是那种满屏圆角卡片、紫蓝渐变、千篇一律的垃圾 UI(英文叫 slop,翻译成「AI 味」很贴切)。
- 核心技能 v2 版:读需求→推断设计语言→调三个旋钮(VARIANCE 变化度 / MOTION 动效 / DENSITY 密度)
- 多种风格变体:极简(Notion 风)、粗野主义(Swiss 排版)、高级软设计、工业风,挑着用
- 硬性规则:禁止 em-dash 滥用、禁止占位符注释、强制完整输出
- 还能生成设计参考图,配合 ChatGPT 图片生成,再丢给 Codex/Cursor 落地
- MIT 协议,跟 Claude Code、Codex、Cursor 全兼容
上手:npx skills add https://github.com/Leonxlnx/taste-skill 一条命令装完。
实话: 我没实测(我自己写文章不写 UI),但 74K 星里应该有大量被 AI 丑图折磨过的冤种。适合 vibe coding 重度用户、被 AI 前端丑哭的独立开发者。说实话,这项目本身挺「meta」的——用 AI 教 AI 审美,人类在旁边看戏。
3. baidu/Unlimited-OCR — ⭐22.7K,一次性拆完整个文档
百度开源的 OCR 模型,主打「一次长程解析」:一张图、一个几十页 PDF,一次推理全拆完,不用分页切块。官方说是把 DeepSeek-OCR 再往前推一步,MIT 协议直接开源。
- 单图 / 多页 PDF 一次解析,最长 32K 上下文
- 支持 transformers、vLLM、SGLang 三种推理方式,还有官方 Docker 镜像
- 论文已发 arXiv,数据、模型 HuggingFace 和 ModelScope 都有
- 对中文文档、版面复杂的扫描件友好(这本来就是百度强项)
上手:transformers 加载 baidu/Unlimited-OCR 就行,GPU 跑;要上生产直接拉 vllm/vllm-openai:unlimited-ocr 镜像起服务,OpenAI 兼容接口。
实话: 没实测,家里没大显存 GPU(模型不小,得 24G 以上才舒服)。适合搞 RAG 的、做档案数字化的、以及被扫描版 PDF 折磨过的打工人。我那个「PDF 转 Markdown」的需求清单上,它已经排进前三了。
4. MiniMax-AI/MiniMax-H3 — ⭐1.1K,能听懂指令的视频生成
MiniMax 刚开源的第三代视频生成系统,星数不高但技术含量拉满:这是一个「全模态」生成系统——文本、图片、视频、音频统一理解,生成视频时自带原生立体声,最高 2K 分辨率、15 秒时长、24fps、32kHz 立体声,支持 11 种语言对话。
- 两种模式:FL2VA(首尾帧生成视频)和 Ref2VA(全参考模式:最多 9 张图 + 3 段视频 + 3 段音频混着当输入)
- H3-Context-IR 模块:先把复杂的多模态指令理解透彻再生成,输出质量关键
- 视频带原生音频,不用后期配音,对口型也稳
- 官方还送了 9 个风格化技能包(产品广告、3D 动画、纸艺定格、MV 字幕……),
npx skills add直接装
上手:仓库代码开源但模型走 API(platform.minimax.io),或者直接海螺网页版玩。
实话: 我就看了看示例视频,没跑本地推理——这玩意儿本地跑不现实,老老实实 API。适合做短视频、广告、游戏宣传片的人,跟之前的视频编辑开源项目刚好互补。
今晚的观察
四个项目放一起,能看出点名堂:AI 在从「能说」往「能干活、干得漂亮」走。Strix 让 AI 干安全测试的脏活,taste-skill 让 AI 输出有审美,OCR 让 AI 读懂长文档,H3 让 AI 直接产出带声音的视频——全是「落地干活」的方向,纯聊天吹水的项目越来越少了。
另外一个有意思的信号:Agent Skills 这个生态是真的起来了,这周两个项目(taste-skill 和 MiniMax-H3)都带技能包,npx skills add 都快成标配了。以后装 AI 能力可能就跟装 npm 包一样自然。
以上项目均未深度实测,信息来自各仓库 README 与官方文档,上手前请自行验证。
by 数码罗记·godsun.pro