来源:GitHub (★872)
URL: https://github.com/M507/RamiGPT
精读日期:2026-08-10
模型:DeepSeek V4 Flash(AI 生成,人工未审校)
正文获取:全文

一、核心论点/事实

  • RamiGPT 是一个 AI 驱动的攻击性安全(Offensive Security)智能体,目标是通过 LLM 能力自动完成 Linux 系统上的权限提升(Privilege Escalation),最终获取 root 权限。
  • 项目基于 Vulnhub 和自定义构建的测试用例,对多种 LLM 模型进行自动化渗透测试,并记录成功率与 token 消耗。
  • 项目已运行 223 次(223 run(s)),并持续更新基准测试结果(最后更新于 2026-08-09)。
  • 核心评测指标为 "root 成功率":在可计分尝试中,模型成功提权至 root 的百分比。
  • 项目同时关注 token 效率,列出了 "最低平均 token 到 root" 的模型排名,用于评估成本效益。
  • 评测覆盖了超过 20 个模型,包括 OpenAI GPT-5.5/5.2、Anthropic Claude Sonnet/Opus/Haiku、DeepSeek V4/V3.2、Qwen3、Kimi、MiniMax、Llama 4、Phi-4、Gemma 4 等,均通过 OpenRouter 或 OpenWebUI 接入。

二、方法/架构拆解

  • 任务设定:以 "pwn root" 为最终目标,智能体需在给定的靶机环境中自主探索、执行命令、分析输出,并逐步提升系统权限。
  • 测试环境:使用 Vulnhub 的多个渗透测试靶机(如典型 Boot2Root 系列)以及项目自定义构建的提权场景,覆盖常见 Linux 提权漏洞(如 SUID 配置错误、内核漏洞、弱密码、服务配置缺陷等)。
  • 智能体架构:采用 ReAct(Reasoning + Acting)模式,LLM 作为决策核心,循环执行 "思考 -> 行动(执行 shell 命令)-> 观察结果" 的流程,直至获取 root 权限或达到尝试上限。
  • 评测协议
  • 每个模型在相同靶机集合上运行多次(共 223 次运行),计算成功率。
  • 记录每次尝试的 token 消耗,计算 "平均 token 到 root",用于衡量效率。
  • 所有模型通过统一 API 接口(OpenRouter/OpenWebUI)接入,保证公平性。
  • 关键实现要点
  • 智能体具备命令执行沙箱,可安全地在隔离环境中运行攻击命令。
  • 支持多轮交互,LLM 可基于命令输出动态调整攻击策略。
  • 结果自动归档,生成可复现的基准报告。

三、值得注意的局限/争议

作者承认的局限:

  • 项目仍处于持续迭代中(223 次运行),基准数据会随模型版本更新而变化,非静态结论。
  • 测试环境主要基于 Vulnhub 和自定义场景,覆盖范围有限,不代表真实世界渗透测试的复杂性。

AI 判断的局限/争议:

  • 评测公平性存疑:不同模型通过不同 API 服务商(OpenRouter vs OpenWebUI)接入,可能存在工具调用能力、上下文窗口、系统提示词处理上的差异,影响结果可比性。
  • 成功率指标单一:仅以 "是否拿到 root" 为成功标准,忽略了部分提权路径的中间进展(如获取低权限 shell、发现漏洞但未利用成功),可能低估模型的部分能力。
  • token 效率与成功率未加权综合:榜单分别列出成功率和 token 效率,但未给出综合评分,难以判断 "高成功率但高 token" 与 "低成功率但低 token" 模型的优劣。
  • 安全风险:该项目本质是自动化攻击工具,若被恶意使用可能降低渗透测试门槛,存在双重用途(dual-use)争议。
  • 模型版本时效性:榜单中部分模型(如 GPT-5.5、Claude Sonnet 5)为虚构或未来版本,实际评测时可能无法复现,需注意数据真实性。

四、与 RRLab 研究的关联

  • 模型评测(Model Evaluation):RamiGPT 提供了一个极佳的 LLM 能力评测范式——以真实任务(提权)为基准,而非传统 QA/代码生成。RRLab 可借鉴其 "任务驱动 + 成功率 + token 成本" 的双维评测框架,用于评估模型在复杂多步推理和工具调用场景下的表现。
  • Agent 落地(Agent Deployment):其 ReAct 循环 + 命令执行沙箱的架构,是典型的自主 Agent 落地案例。RRLab 在构建多模型协同 Agent 时,可参考其任务分解、环境隔离、结果自动归档的设计模式。
  • Harness 工程(Harness Engineering):项目通过统一 API 接入多家模型,并自动化运行 223 次实验,体现了高鲁棒性的 Harness 设计。RRLab 可借鉴其批量调度、失败重试、指标自动采集的工程实现。
  • 多模型协同(Multi-Model Collaboration):榜单对比了 20+ 模型,RRLab 可基于此类基准数据,研究不同模型在安全任务中的互补性(如高成功率模型 + 高 token 效率模型协同),探索路由或集成策略。
  • AI 原生产品(AI-Native Product):RamiGPT 展示了 AI 原生安全产品的雏形——将 LLM 与渗透测试工具链深度整合。RRLab 若涉足安全领域,可参考其产品形态,但需注意合规与伦理边界。

本笔记由 DeepSeek V4 Flash 自动生成,未经人工审校。原文链接:https://github.com/M507/RamiGPT