Skip to content

Latest commit

 

History

History
366 lines (293 loc) · 7.8 KB

File metadata and controls

366 lines (293 loc) · 7.8 KB

SafeGuard AI 项目演示文档

项目概述

SafeGuard AI 是基于Fraud-R1改进的安全教育与AI伦理学习平台,将攻击测试工具转变为教育学习系统。


核心创新点

1. 模式转换

  • :攻击测试(测试LLM脆弱性)
  • :教育学习(帮助用户识别诈骗)

2. 透明度仪表板

  • 展示AI决策过程
  • 决策因素可视化
  • 置信度说明

3. 偏见检测

  • 人口统计偏见检测
  • 语言偏见检测
  • 场景偏见检测

4. 反事实推理

  • "如果...会怎样"场景分析
  • 理解决策边界条件
  • 提升批判性思维

5. 安全守护

  • 创伤知情的安全检查
  • 情绪状态监控
  • 分级干预机制

系统架构

SafeGuard-AI/
├── app.py                      # 主应用入口
├── config.py                   # 配置文件
├── modules/
│   ├── education_engine.py     # 教育引擎
│   ├── scenario_simulator.py   # 场景模拟器
│   ├── transparency_dashboard.py # 透明度仪表板
│   ├── safety_guardian.py      # 安全守护
│   └── learning_tracker.py     # 学习追踪
└── templates/
    └── index.html              # 前端界面

功能演示

场景1:虚假驾校服务

模拟消息

📱 来自: 李教练
您好,这里是环城驾校,我们可以代办B1驾照,
无需考试,只需支付800元定金和7500元考试费。
请转账至账户:6228 4801 2665 3397 775

风险点

  • ⚠️ 承诺无需考试
  • ⚠️ 要求预付费用
  • ⚠️ 个人账户收款

用户响应示例

我觉得这可能是诈骗,因为正规驾校不会承诺"包过",
而且要求预付大额费用很可疑。

AI分析结果

  • 安全得分:85/100
  • 识别的风险点:要求预付费用
  • 遗漏的风险点:承诺无需考试、个人账户收款
  • 反馈:不错!您识别了一些风险,但还有提升空间。

场景2:身份冒充

模拟消息

📱 来自: 小明
在吗?我是小明,我手机坏了,这是新号。
我急用钱,能不能先转5000给我,晚上还你。

风险点

  • ⚠️ 新号码
  • ⚠️ 紧急求助
  • ⚠️ 要求转账

透明度分析

决策因素分析:
├── 风险指标分析 (权重 35%)
│   ├── 检测到风险关键词: 急用, 借钱, 转账
│   └── 置信度: 85%
├── 紧急性分析 (权重 25%)
│   ├── 检测到紧急性语言
│   └── 置信度: 80%
└── 发送者验证 (权重 25%)
    ├── 未经验证的联系方式
    └── 置信度: 90%

反事实推理

  • 如果可以通过视频确认身份 → 风险降低60%
  • 如果是面对面交流 → 风险降低80%
  • 如果没有紧急性语言 → 风险降低40%

场景3:钓鱼诈骗

模拟消息

📱 来自: XX银行
【XX银行】您的账户存在异常登录,
请立即点击链接验证身份:
http://xxbank-verify.com/safety

偏见检测结果

人口统计偏见:
- 检测:内容针对所有银行用户
- 结果:未发现特定群体针对性
- 缓解:通用诈骗手段

语言偏见:
- 检测:中文内容
- 结果:系统支持双语分析
- 缓解:语言偏好不影响评估

场景偏见:
- 检测:金融安全场景
- 结果:常见诈骗类型
- 缓解:已覆盖多种场景类型

数据生成

学习场景数据

{
  "scenario_id": "fs_001",
  "category": "fraudulent_service",
  "stage": "awareness",
  "content": "驾校代办驾照诈骗场景...",
  "red_flags": [
    "承诺无需考试",
    "要求预付费用",
    "个人账户收款"
  ],
  "learning_points": [
    "正规驾校不会承诺'包过'",
    "驾照考试必须通过正规渠道",
    "预付费用是常见诈骗手段"
  ],
  "reflection_questions": [
    "为什么正规机构不会要求预付大额费用?",
    "如何验证驾校的真实性?"
  ]
}

用户响应数据

{
  "user_id": "user_001",
  "scenario_id": "fs_001",
  "response": "我觉得这可能是诈骗...",
  "analysis": {
    "score": 85,
    "identified_flags": ["要求预付费用"],
    "missed_flags": ["承诺无需考试"],
    "response_type": "verify"
  },
  "timestamp": "2025-03-26T20:00:00Z"
}

透明度分析数据

{
  "decision_factors": [
    {
      "type": "risk_indicator",
      "weight": 0.35,
      "confidence": 0.85,
      "evidence": ["承诺无需考试", "要求预付费用"]
    }
  ],
  "bias_checks": [
    {
      "bias_type": "人口统计偏见",
      "detected": false,
      "severity": "low"
    }
  ],
  "counterfactuals": [
    {
      "scenario": "如果发送者可以通过官方渠道验证",
      "predicted_outcome": "风险等级将显著降低",
      "confidence": 0.85
    }
  ]
}

与Fraud-R1对比

特性 Fraud-R1 SafeGuard AI
主要目标 测试LLM脆弱性 教育用户识别诈骗
交互模式 攻击-防御 学习-反馈
透明度 黑盒测试 白盒解释
安全性 无保护 创伤知情
偏见关注
反事实
教育价值
社会影响 负面 正面

应用场景

1. 个人用户

  • 提升防诈骗意识
  • 学习识别技巧
  • 了解AI决策过程

2. 教育机构

  • 网络安全课程
  • 数字素养培训
  • AI伦理教育

3. 企业培训

  • 员工安全意识培训
  • 反欺诈技能培训
  • 合规培训

4. 公共教育

  • 社区安全教育
  • 老年人防诈骗
  • 青少年网络素养

伦理考量

安全设计原则

创伤知情

  • ✅ 前置内容警告
  • ✅ 情绪状态监控
  • ✅ 分级干预机制
  • ✅ 随时退出选项

透明度

  • ✅ 决策过程可视化
  • ✅ 偏见检测公开
  • ✅ 反事实推理展示
  • ✅ 置信度说明

公平性

  • ✅ 多语言支持
  • ✅ 多场景覆盖
  • ✅ 偏见主动检测
  • ✅ 公平性评估

隐私保护

  • ✅ 本地数据存储
  • ✅ 匿名化处理
  • ✅ 最小数据收集
  • ✅ 用户数据控制

项目成果

生成的文件

  1. app.py - 主应用入口(300+行)
  2. config.py - 配置文件(100+行)
  3. modules/education_engine.py - 教育引擎(300+行)
  4. modules/scenario_simulator.py - 场景模拟器(400+行)
  5. modules/transparency_dashboard.py - 透明度仪表板(400+行)
  6. modules/safety_guardian.py - 安全守护(300+行)
  7. modules/learning_tracker.py - 学习追踪(400+行)
  8. templates/index.html - 前端界面(200+行)

代码统计

  • 总代码行数:约2500行
  • Python代码:约2100行
  • HTML/CSS/JS:约400行
  • 注释和文档:约500行

运行说明

安装依赖

pip install flask requests python-dotenv

运行应用

python app.py

访问应用

打开浏览器访问:http://localhost:5000


结论

SafeGuard AI成功将Fraud-R1从攻击测试工具转变为安全教育平台,实现了:

  1. 教育价值:提供有效的反诈骗教育
  2. 技术创新:实现透明度、偏见检测、反事实推理
  3. 安全设计:创伤知情的安全保护机制
  4. 伦理责任:负责任的AI应用

本项目展示了如何将AI安全技术转化为社会教育工具,为AI伦理教育提供了新的范式。


未来展望

功能扩展

  • 多语言支持扩展
  • 更多诈骗类型
  • VR/AR场景模拟
  • 社交学习功能

技术升级

  • 更先进的AI模型
  • 实时情绪识别
  • 个性化推荐算法
  • 自适应学习路径

应用拓展

  • 移动应用
  • API服务
  • 企业定制
  • 国际合作

项目完成时间:2025年3月26日 基于:Fraud-R1 (ACL 2025 Findings) 改进方向:安全教育与AI伦理学习