本文介绍了一种将网络威胁情报报告中的失陷指标(如文件路径、注册表项和命令行指标)转换为安全信息与事件管理(SIEM)检测规则中可验证的正则表达式的方法,该方法结合了大语言模型(LLM)的集成提取与图辅助的组件标注技术。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 计算机(CPU) | — | ≥ 推荐 4 核及以上 | 无需 GPU |
| LangChain | LangChain | ≥ 0.1.x | 大语言模型编排框架 |
| 大语言模型(IOC 提取,单模型模式) | OpenAI | gpt-5.1 | 在禁用集成投票时用于 IOC 提取(第 2 阶段)。temperature = 0.0;max_workers = 5。访问时间:2025-12-15。 |
| 大语言模型(正则表达式生成) | OpenAI | gpt-5.1 | 用于正则表达式生成(第 5 阶段)。下游验证前 temperature = 0.3。访问时间:2025-12-15。 |
| 大语言模型(可扩展性表征) | OpenAI | gpt-5.1 | 用于代表性结果中报告的 6,000 个 IOC 可扩展性运行。访问时间:2025-12-15。 |
| 内存(RAM) | — | ≥ 推荐 16 GB 及以上 | 文档处理所必需 |
| Neo4j | Neo4j, Inc. | ≥ 5.x | 用于 IOC 标准化的图数据库 |
| Neo4j Python 驱动程序 | Neo4j, Inc. | ≥ 5.x | Neo4j 的 Python 接口 |
| 操作系统 | Microsoft / Apple / Linux | Windows、macOS 或 Linux | 支持跨平台运行 |
| PDF 解析 — 主要后端 | Microsoft | MarkItDown ≥ 0.0.x | 第 1 阶段后端;将 PDF/DOCX/HTML/TXT 输入转换为 Markdown。在送入大语言模型处理前,解析输出按 4,000 字符分块。访问时间:2025-12-15。https://github.com/microsoft/markitdown |
| 流水线配置(第 2 阶段 — IOC 提取) | — | 参考默认值 | 单大语言模型模式:temperature = 0.0,max_workers = 5。集成投票模式默认值:每个配置模型重复次数 = 1,最少投票数 = 2。 |
| 流水线配置(第 5 阶段 — 正则表达式生成) | — | 参考默认值 | 生成 temperature = 0.3。验证设置:每个 IOC 使用 5 个确定性负样本进行过生成随机测试。迭代边界:max_iterations = 10,debug_loop_cap = 5,discard_validation_cap = 5。 |
| Python | Python 软件基金会 | ≥ 3.8 | 必需的运行环境 |
| 正则表达式引擎 | Python 标准库 | re 模块 | 用于正则表达式的验证和测试 |
| Streamlit | Streamlit Inc. | ≥ 1.25 | 基于网页的用户界面 |
| 参考实现源代码 | 作者 / GitHub | GitHub 仓库 | 包含 Streamlit 界面、LangChain 流水线、Neo4j 辅助标准化、正则表达式生成、验证工具以及示例配置文件的源代码。获取地址:https://github.com/SOCautomatic/cti-ioc-regex-pipeline。访问时间:2026 年 6 月 11 日。 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可