Python Bleach库怎么用,如何防止XSS攻击?

滚动文字
cleaned = bleach.clean(unsafe_html, tags=allowed_tags)

结果:

第2课 XSS之存储型XSS攻击
加载中
第2课 XSS之存储型XSS攻击

欢迎访问 官网

<marquee>滚动文字</marquee>

### 精细化控制属性白名单仅限制标签是不够的,属性同样是 XSS 的高发区,Bleach 允许通过 `attributes` 参数为每个标签单独配置允许的属性。- 简单列表形式:所有允许标签共享同一组属性。- 字典形式:为不同标签定义不同的属性集(推荐)。```pythonimport bleach# 为不同标签配置不同属性allowed_attrs = {    'a': ['href', 'title', 'rel'],    'img': ['src', 'alt', 'width', 'height'],}unsafe_html = '<a href="http://safe.com" onclick="steal()">链接</a><img src="pic.jpg" onload="hack()">'cleaned = bleach.clean(unsafe_html, tags=['a', 'img'], attributes=allowed_attrs)# 结果:<a href="http://safe.com">链接</a><img src="pic.jpg">

协议过滤与链接转换

Bleach 还能过滤 hrefsrc 中的协议,防止 javascript:alert(1) 这种伪协议攻击。

  • 协议白名单:通过 protocols 参数指定,默认允许 http, https, mailto
  • 自动链接化:使用 bleach.linkify() 将文本中的 URL 自动转换为 <a>
import bleach
text = "请访问 https://google.com 查看详情"
linked_text = bleach.linkify(text)
# 结果:请访问 <a href="https://google.com" rel="nofollow">https://google.com</a> 查看详情

bleach python 与 html.escape 区别

很多开发者在初学时会混淆 bleach.clean()

Python Bleach库怎么用,如何防止XSS攻击?

和 Python 标准库中的 html.escape(),虽然两者都涉及 HTML 处理,但其设计目标和应用场景截然不同。

核心差异对比

维度 html.escape bleach.clean
处理逻辑 全量转义(Escaping) 选择性清洗(Sanitizing)
结果形式 < 变为 &lt;,所有 HTML 失效 保留安全标签,剔除/转义危险部分
适用场景 显示用户原样输入的文本 渲染经过审核的富文本/HTML 内容
性能开销 极低(简单的字符串替换) 较高(需要解析 DOM 树)
安全性 绝对安全(因为不渲染任何 HTML) 高度安全(基于白名单过滤)

场景选择指南

  • 场景 A:用户评论区,如果要求用户只能输入纯文本,请直接使用 html.escape(),这样无论用户输入什么,页面都会将其视为文字显示,不会被浏览器执行。
  • 场景 B:博客编辑器/CMS 系统,如果允许用户使用加粗、斜体、插入图片,则必须使用

    Python Bleach库怎么用,如何防止XSS攻击?

    bleach.clean(),它能在保证页面布局不被破坏的前提下,剔除恶意脚本。

行业共识认为,安全防御应采取分层策略,在存储阶段可以使用 Bleach 进行初步清洗,在渲染阶段根据上下文选择合适的转义方法,构建深度防御体系。

Django 项目中使用 bleach 库的性能

在高性能的 Web 应用中,尤其是使用 Django 或 Flask 等框架时,频繁调用 Bleach 的解析过程可能会成为性能瓶颈,因为 Bleach 依赖的 html5lib 在解析大型 HTML 文档时速度相对较慢。

性能优化策略

为了在保证安全的同时不牺牲响应速度,可以采取以下优化方案:

  • 清洗时机前移:不要在每次页面渲染(Template 渲染)时调用 bleach.clean(),应该在数据写入数据库之前(如在 Django Model 的 save() 方法或 Form 的 clean() 方法中)进行一次性清洗。
  • 结果缓存:对于不经常变动的富文本内容,将清洗后的 HTML 结果缓存到 Redis 中,避免重复解析。
  • 限制输入长度:在调用 Bleach 之前,先对输入字符串进行长度截断,处理 10KB 的 HTML 和处理 1MB 的 HTML 在性能上有着量级差别。

实际集成路径

在 Django 中,最优雅的集成方式是自定义模板过滤器(Template Filter):

  1. 在 app 目录下创建 templatetags 文件夹。
  2. 编写过滤器代码:
from django import template
import bleach
register = template.Library()
@register.filter(name='safe_html')
def safe_html(value):
    # 定义业务所需的白名单
    allowed_tags = ['b', 'i', 'u', 'p', 'br']
    return bleach.clean(value, tags=allowed_tags)

Python Bleach库怎么用,如何防止XSS攻击?

  1. 在模板中使用:{{ content|safe_html|safe }},注意,|safe 是 Django 的内置过滤器,告诉模板引擎不要再次转义 Bleach 已经清洗过的安全标签。

Bleach 为 Python 开发者提供了一种结构化、可配置的 HTML 清洗方案,通过白名单机制有效解决了 XSS 攻击这一核心痛点,在实际应用中,应根据业务需求精准配置标签和属性白名单,并结合 html.escape 实现分层防御,同时通过前置清洗和缓存来抵消解析性能的损耗。

Bleach Python 相关常见问题 Q&A

Bleach 库目前是否还在维护?

Bleach 依然是 Python 社区处理 HTML 清洗的主流选择,虽然更新频率有所降低,但其基于 html5lib 的解析逻辑依然稳健,对于绝大多数 Web 应用的 XSS 防御需求,它提供的功能已经足够且成熟。

Bleach 能处理 SVG 标签中的恶意代码吗?

SVG 标签非常复杂,内部可以包含 <script>onload 事件,如果将 svg 加入白名单,必须极其谨慎地配置其允许的属性,据统计,许多 XSS 漏洞正是通过允许 SVG 标签但未严格限制属性而产生的,建议除非必要,否则不要在白名单中开启 svg

如果我想完全删除非法标签而不是转义它们该怎么做?

在调用 bleach.clean() 时,可以通过设置 strip=True 参数来实现,默认情况下,Bleach 会将非法标签转义为 &lt;tag&gt; 形式显示在页面上;设置 strip=True 后,非法标签及其内容将被直接从字符串中删除。

首发原创文章,作者:王坚‌,如若转载,请注明出处:https://test.idctop.com/article/488172.html

(0)
怎么用Excel快速对账,两个表格如何自动核对?
上一篇 2026年7月12日 18:34
快云科技618VPS有什么优惠,香港CN2服务器哪家好?
下一篇 2026年7月12日 18:37

相关推荐

  • QQ飞车加成都有哪些服务器,哪个服务器加成最多

    QQ飞车中的加成效果主要由游戏内道具、宠物、贵族系统以及不同服务器区域(如新区、老区、电信网通区)提供,其中服务器稳定性和延迟直接影响加成体验,熟悉这些来源能帮你更高效地提升等级与战力,QQ飞车加成类型全梳理游戏内的加成覆盖经验、金币、道具和属性四大维度,它们各自有独立的触发机制,与服务器区域没有直接绑定,但服……

    2026年8月22日
    300
  • 服务器控件调用js方法怎么实现,服务器控件如何调用js函数

    服务器控件与JavaScript方法的交互,核心在于打破服务器端与客户端的执行边界,通过“属性注入”与“事件映射”机制,实现数据从后端向前端的精准流动,最关键的结论是:服务器控件本身无法直接“调用”JavaScript,而是通过渲染HTML时将JS函数名写入客户端事件属性(如onclick),或利用Client……

    2026年3月11日
    12600
  • python自学难吗?零基础python自学路线

    自学 Python 是一条非常清晰且回报丰厚的路径,Python 因其语法简洁、接近自然语言的特点,被公认为最适合初学者的编程语言之一,以下是一份结构化的Python 自学路线图,帮助你从零开始,系统地掌握 Python:第一阶段:基础语法入门(预计 2-4 周)目标:能够读懂代码,编写简单的脚本解决小问题,环……

    2026年7月10日
    14100
  • 规则引擎风控用户黑名单怎么查?风控黑名单入库规则

    规则引擎风控用户黑名单的核心在于通过实时行为分析拦截恶意账号,从而将欺诈损失降低至行业最低水平,保障平台资产安全,在数字化交易日益频繁的今天,单纯依靠人工审核已无法应对海量的并发请求,风控系统必须像一位经验丰富的老练保安,既要有敏锐的直觉,又要有铁面无私的规则,用户黑名单并非简单的名单罗列,而是一套动态的、多维……

    2026年7月4日
    17900
  • 游戏日常服务器都有哪些类型呢,哪个更稳定

    游戏日常服务器通常指开黑语音专用服务器、轻量级云游戏主机、多人联机存档服务器、社区专用游戏面板服务器等几大类,日常开黑最常用的其实是免费语音工具加腾讯云轻量服务器搭建的联机存档服务器,以及适合小团队的Minecraft、幻兽帕鲁、CS2社区服等自建专属服务器,日常游戏服务器的常见类型开黑语音服务器语音沟通是组队……

    2026年8月23日
    000
  • Web开发中哪些是服务器端技术?,怎么学?

    服务器端技术是Web开发中负责处理业务逻辑、数据存储与交互、安全控制及服务部署的全部后台技术栈,核心涵盖服务器操作系统与Web服务器、后端编程语言与框架、数据库与缓存、API网关与中间件、以及安全防护与运维监控等关键领域,服务器端技术的基础设施层没有稳固的底层,上层应用就是空中楼阁,服务器端技术的物理根基,是你……

    2026年7月27日
    400
  • 高级计算器js怎么用?JavaScript在线计算器代码

    2026年开发与应用高级计算器js的核心结论是:摒弃传统eval()函数,采用AST(抽象语法树)解析与WebAssembly融合架构,是实现金融级精度与毫秒级响应的唯一标准路径,技术演进:为何传统计算器JS已被淘汰浮点数精度危机与行业阵痛在前端开发领域,1 + 0.2 !== 0.3是经典的IEEE 754双……

    2026年4月26日
    5900
  • 服务器如何开启ATS?服务器开启ATS详细步骤教程

    服务器开启ATS(App Transport Security)是提升iOS应用数据传输安全性的核心策略,能强制应用通过HTTPS加密通信,防止中间人攻击和数据泄露,核心结论:开启ATS后,应用安全性提升90%以上,但需确保服务器配置符合苹果安全标准,否则可能导致连接失败,ATS的核心作用ATS要求服务器必须支……

    2026年4月4日
    8100
  • 服务器端和客户端是如何通讯的,通讯原理是什么?

    服务器端和客户端通过互联网协议(主要是HTTP/HTTPS协议)进行通讯,本质上是“请求-响应”模型的循环:客户端发起请求,服务器处理并返回数据,这个过程中涉及DNS解析、TCP连接建立、数据传输、内容渲染等多个环节,以下从原理到实操,拆解一次完整的通讯旅程,服务器端和客户端通信原理:先看一次请求的完整旅程想象……

    2026年8月8日
    900
  • Linux服务器操作系统主流有哪些,哪个更稳定?

    Linux主流服务器操作系统包括Red Hat Enterprise Linux(RHEL)、Ubuntu Server、Debian、SUSE Linux Enterprise Server等,其中RHEL在企业级市场占据主导,Ubuntu Server凭借云原生亲和力快速增长,Debian则以稳定著称,主流……

    2026年8月8日
    700

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注