位置: IT常识 - 正文

Go分布式爬虫笔记(五)(分布式网络爬虫)

编辑:rootadmin
Go分布式爬虫笔记(五) day508|高性能设计:自顶向下的高性能Go程序设计与优化性能优化分层‍

推荐整理分享Go分布式爬虫笔记(五)(分布式网络爬虫),希望有所帮助,仅作参考,欢迎阅读内容。

文章相关热门搜索词:golang分布式爬虫,分布式爬虫架构图,分布式网络爬虫,基于分布式爬虫的搜索引擎设计与实现,go 分布式爬虫,go 分布式爬虫,分布式爬虫架构图,golang分布式爬虫,内容如对您有帮助,希望把文章链接给更多的朋友!

​​

系统级别

系统级别优化与架构设计:

如何对服务进行拆分如何将服务链接在一起服务调用的关系以及调用频率

各种问题:

如何让服务随着负载的增加具有可扩展性?是否采用 DDD 的架构设计?如何进行分布式的协调?选择何种中间件、缓存数据库与存储数据库?使用何种通信方式?如何设计缓存与数据库的关系,才能避免缓存失效之后大量数据直接打到数据库导致的服务响应变慢甚至服务雪崩的问题呢?分布式系统中数据的一致性,如果业务能够接受读取到的数据不是最新写入的数据,那么就一定能设计出比强一致性读取响应延迟更低的系统。

服务治理:

监控、告警降级策略(限流、重试、降级、熔断)分布式追踪与分布式日志收集程序设计和组织级别

程序设计

功能的拆分流程的抽象使用何种形式组织代码定义清晰的模块间的接口边界使用何种框架并发处理模型搭建的开发流程和规范重点指标体系的设计和监控

高性能程序设计的几个原则:

流程异步化 为了外部用户的体验,降低延迟,有时我们可以结合业务对流程进行异步化,快速返回结果给外部用户。这可以提高用户体验、服务的 QPS 与吞吐量。 例如,任务执行完毕后需要将一些数据存入缓存中。这时可以直接返回结果,并异步地写入数据库。又如,调用一个执行周期很长的函数,可以先直接返回,然后在执行完毕后请求用户给的回调地址。不过要注意的是,无论怎样异步化,终究是需要执行任务的。在执行的关键阶段请求并行化,尽可能把串行改为并行。 你可能听说过华罗庚烧水泡茶的故事,这个故事的要点,就是将整个大任务分割为小任务,让关键任务并行进行处理,这个方案可以大大减少整个任务的处理时间。合理选择与实际系统匹配的并发模型 根据自身服务的不同,需要了解 Go 语言在网络 I/O、磁盘 I/O,CPU 密集型系统在程序处理过程中的不同处理模型。并根据不同的场景选择不同的高并发模型。无锁化与缓存化,保证并发的威力。 试想一个极端的不合理的锁设计,它可能会让所有的用户协程等待某一个协程执行完成,导致并行处理退化为串行执行。无锁化并不是完全不加锁,而是要合理设计并发控制。 例如设计无锁的结构,在多读少写场景用读锁替代写锁,用局部缓存来减少对于全局结构的访问(关于如何设计无锁化结构,你可以参考 sync.pool 库、go 内存分配、go 调度器等模块在并行处理中的极致优化)。

怎么用工具和指标来验证程序实际并行的效率呢?

协程数量调度器的运行方式

获取协程数量的方式:

借助 Debug 库中的 NumGoroutine 函数,GOMAXPROCS 还可以获取逻辑处理器 P;使用 runtime/metrics 包,获取运行时 metric,进而获取到协程数量;通过 pprof 获取当前的协程数量。

调度器:Go调度跟踪

启动 GODEBUG 特定环境变量方式,查看调度器日志;通过 pprof 和 trace 工具,可视化分析调度器的运行状态。代码实施级别

合理代码优化

代码规范

目录结构规范测试规范版本规范目录结构规范代码评审规范开发规范参考UBER 开源的 Go 语言开发规范

数据结构与算法

算法优化数据结构优化

缓存:空间换时间

CPU多级缓存Go运行时调度器Go内存分配器sync.pool

复杂度

benchmark对比

Go分布式爬虫笔记(五)(分布式网络爬虫)

刻意的优化

放入接口中的数据会进行内存逃逸,需不需要优化?

字节数组与 String 互转导致的性能损失需不需要优化?

无用的内存需不需要复用?

定位瓶颈问题

工具:pprof、trace、dlv、gdb

数据结构与算法

序列化

Go 语言的编译时和运行时。例如,之前介绍过的将环境变量 GOMAXPROC 调整为更合适的大小,本质上就是在修改运行时可并行的线程数量。

此外,当并发量上来之后,垃圾回收(GC)也可能成为系统的瓶颈所在。GC 有一段 STW 的时长完全不能执行用户协程,并且在并行标记期间会占用 25% 的 CPU 时间。如果 STW 时间过长,或者并发标记阶段由于频繁的内存分配触发了辅助标记,都会导致程序无法有效处理用户协程,产生严重的响应超时问题。 一般这类 GC 问题可以通过修改代码逻辑减少内存分配频繁,或是借助 sync.pool 等内存池复用内存来解决。

另外,运行时也暴露了一些有限的 API 能够干预垃圾回收的运行,在特殊情况下调整这些参数能够提高程序运行效率:

运行时环境变量 GOGC 可以调整 GC 的内存触发水位,当 GOGC=off 时,它甚至能够关闭 GC 的执行;Runtime.GC() 可以手动强制执行 GC。

另外,设置运行时环境变量 GODEBUG=gctrace=1 可以让运行时打印 GC 的相关日志。

危险的尝试

少用CGOunsafe 库本身不是向后兼容的,这意味着在当前版本中有效的代码在之后的版本中的行为是未知的。另外,对指针进行运算的 uintptr 类型本质上是一个整数,Go 内置的垃圾回收无法对它进行管理。操作指针时,由于 Go 运行时栈的自动扩容,可能导致之前指针指向的内容无效。这些危险的操作,需要开发者摸透使用规则并进行正确的权衡(unsafe 包的具体用法可以参考这篇文章)。思维导图

​​

思考题对一个爬虫服务,通常一个网站之中又会有若干需要进一步爬取的网站,就像一棵树一样。如果放在一个协程中处理,将会非常慢。那么你会考虑怎样的程序设计来保证爬虫的高性能?

下载器和解析器解耦分离,通过chan联系起来,各司其职,不够就增加worker;

所有要爬取的网页连接可以看做是一个DAG图。 可以采用BFS遍历的方式来实现爬取。维护一个待爬取url的channel, 每次从一个网页上获取到下一级的url就加入到这个channel中。 同时, channel的另一侧读取channel, 待爬取url channel 不为空时就读取url并启动一个新的协程去爬取对应url 并解析返回内容。

假如当前服务响应时间 P99 太高,导致了 QPS 无法增加,你觉得可以用什么指标和工具来定位和解决问题?

资源瓶颈,如CPU、内存、磁盘和文件系统 I/O、网络以及内核资源等各类软硬件资源出现了瓶颈,从而导致应用程序的运行受限。对于这种情况,我们就可以用前面系统资源瓶颈模块提到的各种方法来分析。

依赖服务的瓶颈,也就是诸如数据库、分布式缓存、中间件等应用程序,直接或者间接调用的服务出现了性能问题,从而导致应用程序的响应变慢,或者错误率升高。这说白了就是跨应用的性能问题,使用全链路跟踪系统,就可以帮你快速定位这类问题的根源。

应用程序自身的性能问题,包括了多线程处理不当、死锁、业务算法的复杂度过高等等,用火焰图辅助分析.

推荐资料《Designing Data-Intensive Applications》

「此文章为3月Day5学习笔记,内容来源于极客时间《Go分布式爬虫实战》,强烈推荐该课程!/推荐该课程」

本文链接地址:https://www.jiuchutong.com/zhishi/298440.html 转载请保留说明!

上一篇:Vue前端表格导出Excel文件(vue table导出excel)

下一篇:GoogleMap——谷歌地图Api的使用(google map)

  • 酷狗怎么调音乐倍速(酷狗怎么调音乐速度)

    酷狗怎么调音乐倍速(酷狗怎么调音乐速度)

  • 自动播放ppt怎么设置关闭(自动播放PPT怎么取消)

    自动播放ppt怎么设置关闭(自动播放PPT怎么取消)

  • 腾讯视频怎么取消连续包月(腾讯视频怎么取消VIP)

    腾讯视频怎么取消连续包月(腾讯视频怎么取消VIP)

  • 网桥工作在osi的哪一层(网桥工作在互联网络的什么层)

    网桥工作在osi的哪一层(网桥工作在互联网络的什么层)

  • windows窗口组成部分(windows窗口组成元素)

    windows窗口组成部分(windows窗口组成元素)

  • 快手极速版不转圈了怎么办(快手极速版不转圈红包图标)

    快手极速版不转圈了怎么办(快手极速版不转圈红包图标)

  • 拼多多零钱包在哪里(拼多多钱包里的零钱怎么用)

    拼多多零钱包在哪里(拼多多钱包里的零钱怎么用)

  • 抖音播放量是怎么计算的(抖音播放量是怎么算的,重复播放算不算)

    抖音播放量是怎么计算的(抖音播放量是怎么算的,重复播放算不算)

  • 原彩和夜览模式区别(原彩和夜览开哪一个)

    原彩和夜览模式区别(原彩和夜览开哪一个)

  • 拼多多申请加好友是怎么回事(拼多多申请加好友在哪里)

    拼多多申请加好友是怎么回事(拼多多申请加好友在哪里)

  • 花生日记里的花生小店是什么(花生日日记里面的东西好吗?)

    花生日记里的花生小店是什么(花生日日记里面的东西好吗?)

  • 手机通话记录能查多久(手机通话记录能删除吗,怎样操作删除)

    手机通话记录能查多久(手机通话记录能删除吗,怎样操作删除)

  • vivo手机权限管理在哪里(vivo手机权限管理找不到)

    vivo手机权限管理在哪里(vivo手机权限管理找不到)

  • ps怎么覆盖照片(ps怎么覆盖照片内容)

    ps怎么覆盖照片(ps怎么覆盖照片内容)

  • 苹果ipad怎么下载软件(苹果ipad怎么下载免费软件)

    苹果ipad怎么下载软件(苹果ipad怎么下载免费软件)

  • 小米6怎么添加多个界面(小米6怎么添加虚拟按键)

    小米6怎么添加多个界面(小米6怎么添加虚拟按键)

  • 不用电脑怎么设置苹果铃声(不用电脑怎么设置无线网别人无法加入)

    不用电脑怎么设置苹果铃声(不用电脑怎么设置无线网别人无法加入)

  • reno2前置摄像头多少(opporeno2前置摄像头)

    reno2前置摄像头多少(opporeno2前置摄像头)

  • VOLTE怎么关闭(vivo手机volte怎么关闭)

    VOLTE怎么关闭(vivo手机volte怎么关闭)

  • 手机自带wifi怎么设置(手机自带wifi怎么弄)

    手机自带wifi怎么设置(手机自带wifi怎么弄)

  • 华为折叠手机mate x3无线充电(华为折叠手机mateXs3)

    华为折叠手机mate x3无线充电(华为折叠手机mateXs3)

  • 在win7中,为什么数字小键盘开机不启动?(win7为什么现在不能用了)

    在win7中,为什么数字小键盘开机不启动?(win7为什么现在不能用了)

  • 无线网默认网关怎么查详情(wifi默认网关是什么)

    无线网默认网关怎么查详情(wifi默认网关是什么)

  • Mac系统启用休眠模式的方法(mac休眠模式)

    Mac系统启用休眠模式的方法(mac休眠模式)

  • 汇算清缴所得税退回做账
  • 企业以买一赠一
  • 领用自产产品用于职工食堂
  • 信用减值损失在利润表怎么填列
  • 借款应付利息计算
  • 完税凭证和发票一起打印
  • 商铺租赁合同的用途怎么写
  • 分公司独立核算和非独立核算区别
  • 当月未开发票增值税怎么报
  • 软件研发购买的测试用的设备应该怎么做账?
  • 税务系统1+1+5
  • 实收资本印花税是一年一交吗
  • 即征即退增值税政策
  • 增值税不征税收入的三个条件
  • 所得税费用是在哪个科目
  • 增值税专用发票和普通发票的区别
  • 促销活动赠品应如何账务处理
  • 计算企业所得税的公式
  • 什么叫抵免
  • 月末计提固定资产折旧时,应借记
  • rancher2教程
  • php数组根据值排序
  • 64位windows系统下安装Memcache缓存
  • 公司刚成立多久可以注销
  • php制作数字验证码
  • 待摊费用和预提费用属于什么账户
  • 十大网页游戏
  • PHP:imagefilledellipse()的用法_GD库图像处理函数
  • 补缴上年度未开票收入增值税,怎么做账
  • 免税需要什么条件
  • 个体户跟企业户
  • 本月职工工资
  • 进项税额转出和不抵扣的区别
  • 长期待摊费用应该怎么摊销
  • 增值税的纳税时间是多久
  • cityscape dataset
  • 计算机还热门吗
  • javascript手机版
  • is not defined at HTMLInputElement.onclick
  • 从univ.txt文件中去掉机构名称
  • python 元类 详解
  • 工程质保金可以不退吗
  • 货物出库入库怎么记账
  • 增值税报完了能改么
  • 增值税留抵扣额
  • 什么是稳岗补贴呢
  • 补发工资怎么补发
  • 小规模纳税人减按1%怎么计算
  • 专项应付款在借方
  • 装修费一定要摊销吗
  • 税务会计账务处理一般方法有哪些
  • 增资扩股对原股东的影响
  • 资产负债表日后非调整事项应当在附注中披露
  • 公司向股东借款多久必须归还
  • 企业建账可以处于哪几个阶段
  • 账簿的设置和登记要点
  • sqlserver性能优化
  • wind2000
  • linux开机启动ftp
  • 安装fedora进入不到安装界面
  • FreeBSD5.4之apache-2.0.54+php+ZendOptimizer简单安装、设置
  • windows10已经阻止此软件
  • win10预览体验三个选项
  • xp系统超级终端机在哪
  • win10系统版本20h2
  • 怎么免费升级win10系统
  • kb3150220安装失败
  • css ie6 ie7 ff的CSS hack使用技巧
  • div+css网页布局方法
  • angularjs常用总结
  • nodejs inspect
  • 装修时候需要交什么费
  • 税务局电话咨询电话
  • 北京朝阳地税搬哪去了
  • 光伏发电备案证如何办理
  • 地税办理停保
  • 顺丰快递的开票历史如何删除
  • 甲种本什么意思
  • 完税凭证验证码
  • 上海纳税总额
  • 免责声明:网站部分图片文字素材来源于网络,如有侵权,请及时告知,我们会第一时间删除,谢谢! 邮箱:opceo@qq.com

    鄂ICP备2023003026号

    网站地图: 企业信息 工商信息 财税知识 网络常识 编程技术

    友情链接: 武汉网站建设