AI前沿速递|渗透测试Agent、744B本地推理、AI专家天团、文档生成器

封面占位

AI前沿速递|渗透测试Agent、744B本地推理、AI专家天团、文档生成器

晚上好,各位。今晚刷GitHub又有新发现。

先说个趋势感受:AI的落地形态正在「分裂」成两个极端——一头是超轻量的工程工具(渗透测试、文档生成),另一头是超重量的本地推理(744B模型塞进25G内存跑)。中间层的Agent框架反而没那么卷了,因为工具化和规模化才是今年下半年的主旋律。

挑了4个方向完全不同的项目,每个都是之前没聊过的。


1. usestrix/strix — 44K星的AI渗透测试Agent,自动黑你的应用

⭐ 44.1K Stars | Python | Apache-2.0 | 608 commits

GitHub → usestrix/strix

传统渗透测试要么贵(请人手工测),要么废(SAST工具一堆false positive)。Strix不做规则匹配,它部署多AI Agent团队模拟真正黑客的行为——动态运行你的代码、自动发现漏洞、并且生成可复现的Proof of Concept(PoC)。

核心亮点:

  • Agent协作:多个专门Agent并行工作——有的侦察、有的扫描、有的验证,最后PoC输出
  • CI/CD集成:每个PR自动扫描,不安全代码直接block,不回生产
  • 运行时验证:不是静态分析那种「可能有问题」,而是真把你的代码跑一遍证明漏洞可被利用
  • 纯CLI:一行命令装好,对接到GitHub Actions就能用

这玩意儿比之前聊过的传统SAST工具强一截——它不是「按规则找漏洞」,而是「像黑客一样思考」。对DevSecOps团队来说,每周省一个安全审查日的工时完全没问题。

⚠️ 注意:Strix会用AI模型分析你的代码,API key对应的模型厂商能看到你的代码片段。在意代码隐私的话,可以本地部署开源模型做推理。


2. JustVugg/colibri — 19.6K星的「蜂鸟引擎」,25G内存跑744B模型

⭐ 19.6K Stars | C | Apache-2.0 | 626 commits

GitHub → JustVugg/colibri

这个项目的描述让我直接坐直了:「Run GLM-5.2 (744B MoE) on a consumer machine with ~25 GB of RAM — in pure C, with zero dependencies, by streaming experts from disk.」

翻译成人话:把你的游戏本变成744B参数大模型的推理服务器。

怎么做到的?MoE模型每次token只激活约40B参数,其中只有约11B是变化的路由专家。Colibri把模型拆成三级存储:

  • VRAM级(可选):最热的专家常驻显存
  • RAM级(~9.9GB):密集部分(Attention、共享专家、Embeddings)常驻int4量化后约10G
  • NVMe级(~370GB):19456个路由专家流式读取,按需加载

核心算法其实就是JIT编译思想用在权重上——像JIT只编译热路径一样,Colibri只加载热专家。它有学习缓存,用得越多,热专家在高速层的命中率越高,越跑越快。

实测数据:
– 6×RTX 5090全驻留:4 tok/s,TTFT 1.6秒
– 25GB内存笔记本纯磁盘流式:也能跑,只是慢
– 双SSD镜像:负载均衡读带宽,速度翻倍

它还带一个Web Dashboard,能实时看到19456个专家的激活热力图——像个活的大脑皮层。这个可视化是我见过最酷的模型监控界面之一。

之前聊过llama.cpp(本地推理的瑞士军刀)和vLLM(生产级推理引擎),但colibri的定位完全不同——它不是docker式的推理容器,而是「把744B模型塞进你吃灰的第二块SSD」的疯狂工程。适合本地重度推理玩家和对模型内部好奇的技术极客。

⚠️ GLM-5.2权重由Z.ai以MIT协议发布,当前只支持GLM架构,不通用。


3. msitarzewski/agency-agents — 137K星,你的AI专家天团

⭐ 137K Stars | Markdown/Skills | MIT | 393 commits

GitHub → msitarzewski/agency-agents

137K星,不是闹着玩的。这项目诞生于一个Reddit帖子,现在进化成了144+个高度专业化的AI Agent角色,覆盖12个部门:工程、设计、市场、销售、产品、安全、学术、游戏开发、医疗、金融、GIS、空间计算……

每个Agent不是那种「套个prompt就说是专家」的货色,而是有:
– 细分的身份和人格:独特的沟通风格和工作流程
– 技术交付物:实际能跑的代码和过程
– 成功指标:可量化的产出标准

怎么用?有桌面App(macOS/Linux/Windows),一键安装到Claude Code、Cursor、Codex、Gemini CLI、OpenCode等10+工具的skills目录。也可以手动复制单个Agent的markdown文件。

跟之前聊过的mattpocock/skills(183K星,工程师技能包)定位不同——mattpocock/skills是一组「通用工程技能」,而agency-agents是一个按角色分工的专家团队。你想要一个SEO Specialist、一个UX Researcher、还是一个Frontend Developer?直接激活对应角色,它就知道怎么干活。

对我来说这项目最大的价值不是直接用它(144个Agent太多),而是学习怎么给Agent设计角色和流程——每个Agent的markdown文件本身就是一份高质量的prompt engineering教材。


4. langchain-ai/openwiki — 13.3K星,让你Agent读懂你的代码库

⭐ 13.3K Stars | TypeScript | MIT | 194 commits

GitHub → langchain-ai/openwiki

LangChain官方出的项目,解决的问题非常真实:Agent写代码最大的瓶颈不是模型不够强,而是看不懂你的代码库。

OpenWiki是一个CLI工具,自动扫描你的代码库,生成agent-friendly的文档wiki。然后自动更新你的AGENTS.md或CLAUDE.md,加上wiki引用路径——Agent下次干活时直接读wiki,不用从头翻文件。

核心能力:

  • Code Mode:扫描当前repo,在openwiki/下生成文档,支持TypeScript/JS/Python/Go/Rust等主流语言
  • Personal Mode:构建本地个人知识wiki,可以从本地repo、Gmail、Notion、Web Search、Hacker News、X/Twitter等来源自动采集
  • Daily GitHub Action:每天自动更新wiki并提PR,文档随着代码变
  • 内置Connector生态:Confluence、Notion、邮件等10+源接入

跟之前聊过的code-review-graph(19.5K星,代码审查图谱)和codebase-memory-mcp(35K星,MCP代码智能)比——code-review-graph重在PR审查的token节省,codebase-memory-mcp重在结构化知识图谱查询。而OpenWiki的目标更「老派」——生成人能读、Agent也能读的Markdown文档。适合代码库大、Agent经常迷失方向、或者文档常年不更新的团队。

⚠️ 刚发布不久(2026年6月),API还在快速迭代。Personal Mode的Connector目前还比较基础。


今晚的观察

4个项目串起来,其实能看到今年7月AI生态的两个清晰趋势:

第一,安全性成了硬需求。 Strix 44K星的爆发说明——当大家都在用AI写代码、跑Agent,谁来确保这些代码和Agent本身是安全的?AI渗透测试已经从「有趣的玩具」变成了「DevOps流水线里的一环」。

第二,本地推理从「能跑」进化到了「跑大模型」。 Colibri用25GB内存跑744B模型,这放在半年前是不可想象的。MoE架构+磁盘流式+JIT式热加载——这条路如果走通了,意味着本地一台PC能跑以前需要集群才能跑的模型,对隐私敏感场景是game changer。

agency-agents和openwiki则从两个不同角度回答同一个问题:Agent已经够强了,但我们怎么让它更靠谱?一个用专家角色来规范Agent的行为,一个用文档来给Agent铺路。

觉得有用?收藏关注,每日午间+晚间更新AI前沿速递

A7z-爱马仕

by 数码罗记·godsun.pro

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注