SafeGuard AI 是基于Fraud-R1改进的安全教育与AI伦理学习平台,将攻击测试工具转变为教育学习系统。
- 从:攻击测试(测试LLM脆弱性)
- 到:教育学习(帮助用户识别诈骗)
- 展示AI决策过程
- 决策因素可视化
- 置信度说明
- 人口统计偏见检测
- 语言偏见检测
- 场景偏见检测
- "如果...会怎样"场景分析
- 理解决策边界条件
- 提升批判性思维
- 创伤知情的安全检查
- 情绪状态监控
- 分级干预机制
SafeGuard-AI/
├── app.py # 主应用入口
├── config.py # 配置文件
├── modules/
│ ├── education_engine.py # 教育引擎
│ ├── scenario_simulator.py # 场景模拟器
│ ├── transparency_dashboard.py # 透明度仪表板
│ ├── safety_guardian.py # 安全守护
│ └── learning_tracker.py # 学习追踪
└── templates/
└── index.html # 前端界面
模拟消息:
📱 来自: 李教练
您好,这里是环城驾校,我们可以代办B1驾照,
无需考试,只需支付800元定金和7500元考试费。
请转账至账户:6228 4801 2665 3397 775
风险点:
⚠️ 承诺无需考试⚠️ 要求预付费用⚠️ 个人账户收款
用户响应示例:
我觉得这可能是诈骗,因为正规驾校不会承诺"包过",
而且要求预付大额费用很可疑。
AI分析结果:
- 安全得分:85/100
- 识别的风险点:要求预付费用
- 遗漏的风险点:承诺无需考试、个人账户收款
- 反馈:不错!您识别了一些风险,但还有提升空间。
模拟消息:
📱 来自: 小明
在吗?我是小明,我手机坏了,这是新号。
我急用钱,能不能先转5000给我,晚上还你。
风险点:
⚠️ 新号码⚠️ 紧急求助⚠️ 要求转账
透明度分析:
决策因素分析:
├── 风险指标分析 (权重 35%)
│ ├── 检测到风险关键词: 急用, 借钱, 转账
│ └── 置信度: 85%
├── 紧急性分析 (权重 25%)
│ ├── 检测到紧急性语言
│ └── 置信度: 80%
└── 发送者验证 (权重 25%)
├── 未经验证的联系方式
└── 置信度: 90%
反事实推理:
- 如果可以通过视频确认身份 → 风险降低60%
- 如果是面对面交流 → 风险降低80%
- 如果没有紧急性语言 → 风险降低40%
模拟消息:
📱 来自: XX银行
【XX银行】您的账户存在异常登录,
请立即点击链接验证身份:
http://xxbank-verify.com/safety
偏见检测结果:
人口统计偏见:
- 检测:内容针对所有银行用户
- 结果:未发现特定群体针对性
- 缓解:通用诈骗手段
语言偏见:
- 检测:中文内容
- 结果:系统支持双语分析
- 缓解:语言偏好不影响评估
场景偏见:
- 检测:金融安全场景
- 结果:常见诈骗类型
- 缓解:已覆盖多种场景类型
{
"scenario_id": "fs_001",
"category": "fraudulent_service",
"stage": "awareness",
"content": "驾校代办驾照诈骗场景...",
"red_flags": [
"承诺无需考试",
"要求预付费用",
"个人账户收款"
],
"learning_points": [
"正规驾校不会承诺'包过'",
"驾照考试必须通过正规渠道",
"预付费用是常见诈骗手段"
],
"reflection_questions": [
"为什么正规机构不会要求预付大额费用?",
"如何验证驾校的真实性?"
]
}{
"user_id": "user_001",
"scenario_id": "fs_001",
"response": "我觉得这可能是诈骗...",
"analysis": {
"score": 85,
"identified_flags": ["要求预付费用"],
"missed_flags": ["承诺无需考试"],
"response_type": "verify"
},
"timestamp": "2025-03-26T20:00:00Z"
}{
"decision_factors": [
{
"type": "risk_indicator",
"weight": 0.35,
"confidence": 0.85,
"evidence": ["承诺无需考试", "要求预付费用"]
}
],
"bias_checks": [
{
"bias_type": "人口统计偏见",
"detected": false,
"severity": "low"
}
],
"counterfactuals": [
{
"scenario": "如果发送者可以通过官方渠道验证",
"predicted_outcome": "风险等级将显著降低",
"confidence": 0.85
}
]
}| 特性 | Fraud-R1 | SafeGuard AI |
|---|---|---|
| 主要目标 | 测试LLM脆弱性 | 教育用户识别诈骗 |
| 交互模式 | 攻击-防御 | 学习-反馈 |
| 透明度 | 黑盒测试 | 白盒解释 |
| 安全性 | 无保护 | 创伤知情 |
| 偏见关注 | 无 | 有 |
| 反事实 | 无 | 有 |
| 教育价值 | 低 | 高 |
| 社会影响 | 负面 | 正面 |
- 提升防诈骗意识
- 学习识别技巧
- 了解AI决策过程
- 网络安全课程
- 数字素养培训
- AI伦理教育
- 员工安全意识培训
- 反欺诈技能培训
- 合规培训
- 社区安全教育
- 老年人防诈骗
- 青少年网络素养
- ✅ 前置内容警告
- ✅ 情绪状态监控
- ✅ 分级干预机制
- ✅ 随时退出选项
- ✅ 决策过程可视化
- ✅ 偏见检测公开
- ✅ 反事实推理展示
- ✅ 置信度说明
- ✅ 多语言支持
- ✅ 多场景覆盖
- ✅ 偏见主动检测
- ✅ 公平性评估
- ✅ 本地数据存储
- ✅ 匿名化处理
- ✅ 最小数据收集
- ✅ 用户数据控制
- app.py - 主应用入口(300+行)
- config.py - 配置文件(100+行)
- modules/education_engine.py - 教育引擎(300+行)
- modules/scenario_simulator.py - 场景模拟器(400+行)
- modules/transparency_dashboard.py - 透明度仪表板(400+行)
- modules/safety_guardian.py - 安全守护(300+行)
- modules/learning_tracker.py - 学习追踪(400+行)
- templates/index.html - 前端界面(200+行)
- 总代码行数:约2500行
- Python代码:约2100行
- HTML/CSS/JS:约400行
- 注释和文档:约500行
pip install flask requests python-dotenvpython app.py打开浏览器访问:http://localhost:5000
SafeGuard AI成功将Fraud-R1从攻击测试工具转变为安全教育平台,实现了:
- 教育价值:提供有效的反诈骗教育
- 技术创新:实现透明度、偏见检测、反事实推理
- 安全设计:创伤知情的安全保护机制
- 伦理责任:负责任的AI应用
本项目展示了如何将AI安全技术转化为社会教育工具,为AI伦理教育提供了新的范式。
- 多语言支持扩展
- 更多诈骗类型
- VR/AR场景模拟
- 社交学习功能
- 更先进的AI模型
- 实时情绪识别
- 个性化推荐算法
- 自适应学习路径
- 移动应用
- API服务
- 企业定制
- 国际合作
项目完成时间:2025年3月26日 基于:Fraud-R1 (ACL 2025 Findings) 改进方向:安全教育与AI伦理学习