LeionTong · Daily Github · NO.07 2026-09-10 · 10:16 GMT+8

Agent 上生产要补的运行层
与物理 AI 的评测框架

今日五条没有一个新模型。Maka 把 Agent 的每一次工具调用写成可审计日志,SkillHub 管住企业内部 skill 的版本与权限,Ripwire 压掉编码 Agent 的上下文开销,Temps 把七项 SaaS 订阅并成一个自托管二进制,Inspect Robots 让机器人团队在仿真里先建立评测基线。交付形态都是纯软件、私有化、License 友好。

Date2026-09-10
Picks主流 2 · 小众 3
Gate加权 ≥ 3.5 / 5.0
SourcesTrending · Search · HN

数据口径:star 数、License、最近提交均取自 2026-09-10 当日 GitHub API 实检;「近 X 天 +X」取自当日 GitHub Trending 月 / 周榜,未上榜者标注「未获取到」,不作估算。评分权重:商业化 30% · 规模化 25% · 边际成本 20% · 验证速度 15% · 成熟度 10%。

01

Apache Maka apache/maka

⭐ 5,141 近 30 天 +3,880 TypeScript Apache-2.0 提交 2026-09-09 · 仅 nightly 主流

定位Apache 孵化中的 Agent 工作台,把每一次模型消息、工具调用、权限决策与终止写成 append-only 的 RuntimeEvent 日志,UI、崩溃恢复与下一轮 prompt 都是这份日志的投影。

痛点企业不敢让 Agent 上生产,因为事后说不清它改了什么、调了什么、谁批准的。它把可审计做成运行时本身,并公开同模型同 verifier 的 per-task 评测。

谁付钱需要 Agent 操作留痕与合规审计的企业(金融、政企、制造业质量体系);路径是私有化部署 + 企业支持与审计报表层。Apache-2.0 无授权障碍。

规模化审计留痕跨行业通用,桌面 / TUI / CLI 共用同一 Runtime Host,交付标准化,不依赖驻场实施。

边际成本 —— 纯软件分发,无专有硬件,无重人力交付。

验证≤30 分钟:

# 路径一:下载 macOS / Windows Nightly 安装包
# https://maka.apache.org/en/downloads/
# 首次启动后 Settings → Models 填自己的 API 或本地模型即可开跑

# 路径二:源码
 git clone https://github.com/apache/maka.git
cd maka && npm ci && npm run dev   # Node.js 22.19+

官方尚未发布 Apache 正式 release,下载页提供的是每日构建的 Desktop Nightly(Windows / Linux 为未签名预览版)。

风险尚无 Apache 正式 release,Windows 与 Linux 构建未签名,不宜直接进生产;coding agent 赛道极拥挤,差异化只落在可审计与公开评测,随时被上游 harness 追平。

商业化
3 / 5
规模化
4.5 / 5
边际成本
5 / 5
验证速度
4 / 5
成熟度
4 / 5
加权总分 4.03 / 5.00
02

SkillHub iflytek/skillhub

⭐ 5,071 近 30 天 未获取到 Java Apache-2.0 v0.2.19 · 提交 2026-09-09 主流

定位企业私有 Agent Skill 注册中心——发布、版本、命名空间、搜索与 CLI 安装,配 RBAC 与审计日志,Docker / K8s 内网部署。

痛点企业内部的 skill 散落在个人目录和网盘,无法版本化,也无法管控谁能装谁的、出了事无从追溯。

谁付钱已引入 Agent 的大型企业与政企,按私有化部署与运维支持收费;也可作为 AI 资产纳管模块并入既有中台项目一起报价。

规模化凡把 Agent 引入研发或客服流程的组织都需要,交付就是一次容器部署加命名空间规划,可复制。

边际成本 —— Java 21 + React 19,依赖数据库与对象存储,无 GPU 无专用设备。

验证≤30 分钟:

curl -fsSL https://imageless.oss-cn-beijing.aliyuncs.com/runtime.sh | sh -s -- up \
  --public-url https://skillhub.your-company.com

npx @astron-team/skillhub@latest publish ./my-skill --namespace my-space

国内网络可加 --aliyun 走镜像;CLI 也可用 npx clawhub install my-skill --dir ~/.claude/skills 直接装进编码 Agent。

风险技术栈偏重(Java 21 + React 19);企业内部 skill 生态仍在早期,客户若没沉淀 skill 就先买了空货架;讯飞背书同时意味着部分客户会在意数据回流。

商业化
4 / 5
规模化
4.5 / 5
边际成本
4.5 / 5
验证速度
4 / 5
成熟度
4 / 5
加权总分 4.23 / 5.00
03

Temps gotempsh/temps

⭐ 736 近 30 天 未获取到 Rust Apache-2.0 v0.1.0-nightly · 提交 2026-09-09 小众

定位一个自托管 Rust 二进制,把 Vercel + Sentry + PostHog + Pingdom + Resend + E2B + Datadog 七项订阅并成一套,440+ 操作同时是 CLI 命令并自带 Agent Skills。

痛点小团队每接一个项目就多叠几张 SaaS 账单,数据还分散在七家厂商。它让部署、追踪、分析、会话回放、邮件、沙箱与 AI 网关落在自己的服务器上,且可由 Agent 直接操作。

谁付钱替代的是每席位每月几十到几百美元的订阅;可变现形态是替客户做私有化 PaaS 交付与运维托管,或打包成行业模板出售。Apache-2.0 无分成义务。

规模化凡有 Web 应用要上线的团队都通用,脚本化部署即标准交付,不涉及现场定制开发。

边际成本 —— 纯软件,新增客户只增加一份服务器实例,无硬件无驻场。

验证≤30 分钟:

curl -fsSL https://temps.sh/deploy.sh | bash

# 装完确认 440+ 操作可用
bunx @temps-sdk/cli projects list
bunx @temps-sdk/cli analytics ai-agents -p my-app --period 7d

自带 Claude Code / Codex / OpenCode 的 skills 文件,放到 .claude/skills/ 后可用自然语言指挥部署、查 trace、加域名。

风险覆盖面过宽(69 组 440+ 操作),单点深度可能不及专用工具;尚在 v0.1.0-nightly、建库约 11 个月仅 736★,生产级样本不足;替代 Vercel 意味着客户要自己承担运维责任,这是销售而非技术问题。

商业化
5 / 5
规模化
4 / 5
边际成本
5 / 5
验证速度
4 / 5
成熟度
3 / 5
加权总分 4.40 / 5.00
04

Ripwire redhat-et/ripwire

⭐ 1,834 近 30 天 未获取到 C++ Apache-2.0 v0.5.0 · 提交 2026-09-10 小众

定位给编码 Agent 的代码库地图——零依赖 C++23 CLI 兼 MCP 服务器,输出带排序的确定性调用图,回答该改哪、会波及什么、要跑哪些测试。

痛点Agent 靠 grep 加整文件读取找代码,同一个检索付两遍 token。它用签名替代函数体(自述省 74.7% 字节),每次回答标注置信边界与截断情况,并可设 token 预算。

谁付钱省的是编码 Agent 的 token 与等待时间;可变现形态是作为团队级上下文服务按席位收费,或并入既有研发效能平台。

规模化凡在用 Claude Code / Codex / Cursor 的团队都是受众,交付就是一个可执行文件或 MCP 端点,零配置。

边际成本 —— 单二进制零运行时依赖,无 API key、无向量库、无索引服务。

验证≤30 分钟:

RIPWIRE_REPO=redhat-et/ripwire bash -c "$(curl -fsSL \
  https://raw.githubusercontent.com/redhat-et/ripwire/main/scripts/install.sh)"

# 对自己的仓库跑一次,对比改前改后的 token 消耗

覆盖 Rust / C++ / Python / Go / TS 等 22 种语言;从源码构建仅需 CMake(pip install cmakebrew install cmake)。

风险建库仅 6 周、v0.5.0,17 个 open issue,语言覆盖广但各语言深度不一;省下的 token 是省钱而非创收,需要客户已有可观的 Agent 用量才能算清账。

商业化
3.5 / 5
规模化
4.5 / 5
边际成本
5 / 5
验证速度
5 / 5
成熟度
4 / 5
加权总分 4.33 / 5.00
05

Inspect Robots robocurve/inspect-robots

⭐ 398 近 30 天 未获取到 Python MIT v0.58.0 · 提交 2026-09-02 小众

定位Physical AI 的开源评测框架——一次定义 benchmark,就能把任意策略(LLM Agent 或 VLA)跑在任意本体(真机臂、人形或仿真器)上,输出可审计日志并接 Rerun 可视化。

痛点机器人团队换一个模型或换一个本体,评测就得重写一遍,结果还无法横向比较。它把 Inspect AI 的做法搬到物理 AI,评分、LLM 交互与完整配置都留档。

谁付钱机器人与具身团队为可复现的评测与回归基线付钱;可变现形态是评测体系搭建服务、行业 benchmark 套件与企业内回归流水线部署。MIT 无授权包袱。

规模化受众窄但付费意愿集中;交付为标准 Python 包加配置文件,仿真路径与进程内策略均不需要真机,不触发重硬件否决。

边际成本 —— 输入输出都是文件与日志,无本体、传感器或 GPU 集群强制要求(部分策略需 GPU 服务器,可用 mock 策略跳过)。

验证≤30 分钟:

uv venv && uv pip install inspect-robots
source .venv/bin/activate
inspect-robots setup          # 向导写 ~/.config/inspect-robots/config.ini

# 装一个本体插件后直接下指令
uv pip install inspect-robots-yam
inspect-robots "place the fork on the plate"

每次运行会拉起 Rerun viewer 实时串流相机、本体感知与动作。进程内策略(agent 或 mock scripted)不需要任何服务器。

风险README 自述 alpha、API 可能在版本间变动,生产依赖前需锁版本;默认策略 MolmoAct2 需另起 GPU 服务器且不会自愈重启;建库两个半月、398★,生态插件仍在铺。

商业化
3.5 / 5
规模化
3.5 / 5
边际成本
5 / 5
验证速度
4 / 5
成熟度
3 / 5
加权总分 3.83 / 5.00

一、今日首选

gotempsh/temps(加权 4.40)。它是今日唯一能把「替代了哪几张账单」逐项点名、且替代对象都是明码标价的成熟订阅的项目。自托管二进制即交付,不需要实施团队;440+ 操作同时是 Agent 可直接调用的 CLI,运维本身可以被自然语言接管。

二、组合观察

五条里有四条卖的都不是模型能力,而是 Agent 用起来之后必须补的那一层:Maka 补留痕、SkillHub 补资产纳管、Ripwire 补上下文成本、Temps 补运行平台;Inspect Robots 把同一套「先有评测与留痕,再谈上本体」的逻辑搬到了物理 AI。

共同形态是清一色的纯软件、私有化部署、Apache-2.0 或 MIT,账都算在替代既有订阅与合规成本上——竞争已经不在授权,而在谁先把替换账算给客户看。

三、暂不建议碰

  1. freellmapi(tashfeenahmed/freellmapi,⭐ 25,232,近 30 天 +7,218)— 聚合 34 家免费供应商 635 个端点成统一 /v1 接口,方向正确但作者自述 "Personal experimentation only"。免费额度受各家用量条款与风控约束,无法作为交付给客户的 SLA 承诺,热度与可商用性无关。
  2. humanizer(blader/humanizer,⭐ 46,012,本周 +5,925)— 本质是给 Agent 用的去 AI 味提示词技能,无产品形态、无收费入口、复制成本为零,fork 一份即等价,热度来自安装量而非付费意愿。
Daily Github · NO.07 · 五维加权筛选 数据实检于 2026-09-10 · GitHub API + Trending 日 / 周 / 月榜 + HN Algolia