AI SECURITY / LOCAL-FIRSTRESEARCH OS — 2026

01

BUILD AI.
BREAK ASSUMPTIONS.

把一个授权目标交给 AI。Fieldwork 在明确 Scope、执行边界与证据标准下,自动梳理攻击面、建立可证伪假设、执行适用验证,并生成可复核的研究成果。

探索系统↓
AUTHORIZEDVERIFIABLELOCAL-FIRST
SCOPE BEFORE ACTION✦EVIDENCE BEFORE CLAIM✦VERIFY BEFORE REPORT✦HUMAN CONTROL AT THE EDGE✦SCOPE BEFORE ACTION✦EVIDENCE BEFORE CLAIM✦VERIFY BEFORE REPORT✦HUMAN CONTROL AT THE EDGE✦

AI 让分析更快,也让错误更快。

让 AI 负责推进,
让证据负责定论。

Fieldwork 不是会“宣布漏洞”的聊天机器人。它是一套受控研究系统:模型提出假设、编排工具与整理材料;确定性验证器、负对照和独立重放决定结论是否成立。

网页、源码、工具输出与模型输出都被视为不可信输入。没有授权范围,不执行主动动作;没有可复核证据,不生成 VERIFIED Finding。

01

Scope before action

先冻结目标、授权、规则和预算,再允许任何执行。

02

Evidence before claim

每个判断指向来源、环境、命令、原始材料与哈希。

03

Verify before report

工具命中只是观察;验证、反证和影响依据共同决定结论。

从目标,
到可提交结论。

对外是一条简单路径;内部是严格的数据、执行与证据管线。

  1. 01目标与授权Target / Rules / Scope
  2. 02攻击面建模Map / Identity / State
  3. 03AI 假设生成Hypothesis / Counterproof
  4. 04受控验证Oracle / Replay / Receipt
  5. 05影响与交付Impact / Report / Package
TRUTH GATEObservation ≠ Finding

模型置信度不是漏洞成立概率。验证失败、环境错误、材料缺失与反证成功分别记录,不用一个“失败”状态掩盖事实。

一个核心,
三类安全边界。

共享同一套 Scope、Evidence、Verification 与 Reporting 核心;每个研究域保留自己的攻击面和专用 Oracle。

AI / 001

审计 Agent 的行为,
不是它的自我描述。

围绕提示注入、工具越权、秘密泄露、策略绕过和不可控副作用,比较 Agent 声称的行为与真实遥测、工具调用和策略结果。

01

Policy × Telemetry

把系统策略、Agent 自述与真实执行轨迹分开,定位越权调用和边界偏移。

02

Prompt-injection resistance

把网页、文档、源码与工具输出视为不可信数据,验证它们能否改变执行策略。

03

Side-effect verification

检查网络、文件、凭据和外部动作的实际副作用,并保留可追踪证据。

THE OUTPUT

不是更多警报。
是更少、更真的结论。

每个正式结论都要回答:发生了什么、在什么条件下成立、如何复现、有哪些反证、谁受到影响,以及哪些地方仍然未知。

CANONICAL FINDINGVERIFIED
5/5required layers present
  • 01授权与范围快照 ✓
  • 02可证伪安全假设 ✓
  • 03机器验证与负对照 ✓
  • 04独立重放材料 ✓
  • 05影响依据与局限 ✓
REPORT.MDEVIDENCE/REPLAY/MANIFEST.JSON
LOCAL-FIRST

研究数据、源码与证据优先留在用户设备;远端模型调用遵循数据分类和最小披露。

FAIL-CLOSED

缺少 Scope、隔离、凭据或验证前提时停止,不自动降级为不安全执行。

HUMAN-CONTROLLED

高风险动作、规则歧义和正式结论保留清楚的人类判断点。

从个人研究工作台,
走向可信的 AI 安全基础设施。

路线按安全底座、验证闭环、真实协议与独立测评推进。未通过验收的能力,不包装成已完成。

NOW / P0

保护研究者与设备

会话鉴权、执行代理、不可信项目隔离、凭据与网络出口控制。

安全底座
NEXT / P1

让候选自动走到结论

一键挖掘、材料自动补齐、专用验证器、任务恢复与证据收据。

验证闭环
THEN / P2

用真实场景衡量质量

独立项目留出集、真实协议绑定、精确率、召回率和独立重放率。

公开边界

FIELDWORK / AI SECURITY RESEARCH OS

Question everything.
Prove what matters.

回到顶部 ↑查看源码 ↗