
课程介绍:
AI 算力狂飙,存储成为新战场。大模型训练需求年增10倍,80%企业面临存储架构与AI脱节瓶颈——数据加载慢、扩容难等问题。市场急需”懂AI的存储工程师”,岗位薪资涨幅达25%+,具备 AI 场景经验者年薪超50万。本课程聚焦 Ceph 技术与 AI 大模型训练场景融合,结合 JuiceFS 加速、DeepSeek 实战,PB级存储架构设计、高并发优化、生产级故障恢复技能,助你快速成为”存储+AI”复合型工程师,抢占AI时代高薪赛道。
课程目录:
第1章 AI+Ceph分布式存储工程实战–课程导学
1 节|14分钟
-
视频:1-1 AI+Ceph 分布式存储工程实战–课程导学试看13:56
第2章 AI时代的数据基石
9 节|75分钟
-
视频:2-1 AI发展的核心要素:数据、算力与算法的协同演进06:06
-
视频:2-2 分布式存储:大模型时代的必备基础设施06:46
-
视频:2-3 六大优势解读:为何分布式存储是AI人才必争之地07:37
-
视频:2-4 技术红利前瞻:早期布局存储技术的个人与企业机遇试看05:21
-
视频:2-5 技术全景扫描:AI分布式存储体系全解析10:52
-
视频:2-6 从本地到云:存储演进与分布式存储的本质13:22
-
视频:2-7 存储类型解析:分布式存储的多元应用场景11:47
-
视频:2-8 未来趋势:AI与存储的深度融合与协同进化07:17
-
视频:2-9 主流大模型盘点:国内外AI存储需求对比分析05:16
第3章 搭建生产级分布式存储集群环境准备
9 节|124分钟
-
视频:3-1 集群架构设计:从规划到部署的全局视角试看06:34
-
视频:3-2 初探Ceph:开源分布式存储系统的核心架构09:56
-
视频:3-3 硬件选型与配置:构建高可靠存储节点的关键要素17:41
-
视频:3-4 操作系统与环境配置:打造稳定的集群运行基石26:57
-
视频:3-5 内部Yum源搭建:实现规模化高效部署21:18
-
视频:3-6 Ansible自动化运维:批量配置与管理的利器09:39
-
视频:3-7 Chrony时间同步:保障分布式系统一致性的守护者15:41
-
视频:3-8 节点安全加固:基础防护与访问控制策略12:34
-
视频:3-9 本章回顾:环境准备的关键要点总结03:24
第4章 从零打造你的分布式存储集群
11 节|181分钟
-
视频:4-1 生产级集群部署:从规划到上线的全流程06:09
-
视频:4-2 Monitor部署与集群初始化24:16
-
视频:4-3 MGR深度解析:集群监控与管理的智能中枢07:58
-
视频:4-4 OSD批量部署:标准化硬盘初始化实战 (一)19:16
-
视频:4-5 OSD批量部署:标准化硬盘初始化实战 (二)25:07
-
视频:4-6 副本存储池设计:为AI小文件训练优化性能 (一)16:25
-
视频:4-7 副本存储池设计:为AI小文件训练优化性能 (二)17:30
-
视频:4-8 EC纠删码存储池设计:大文件存储的经济高效方案24:38
-
视频:4-9 PG动态调优实战:实现存储池的智能负载均衡16:59
-
视频:4-10 CRUSH地图定制:掌握数据分布与故障域的设计艺术18:52
-
视频:4-11 本章回顾:集群部署核心技能总结02:54
第5章 分布式存储集群中的对象存储
18 节|282分钟
-
视频:5-1 对象存储架构解析:数据访问模式与设计原则05:00
-
视频:5-2 Ceph RGW:开源S3兼容存储的实现之道05:05
-
视频:5-3 存储池功能划分:策略化数据管理(一)25:39
-
视频:5-4 存储池功能划分:策略化数据管理(二)12:45
-
视频:5-5 多RGW高可用部署:构建弹性对象存储门户(一)16:48
-
视频:5-6 多RGW高可用部署:构建弹性对象存储门户(二)14:49
-
视频:5-7 生命周期策略实战:智能数据清理与归档28:48
-
视频:5-8 GC机制与空间优化:垃圾回收原理与配置10:48
-
视频:5-9 元数据管理模式:Index与Indexless的优劣对比24:23
-
视频:5-10 功能验证实战:使用s3cmd全面测试对象存储09:22
-
视频:5-11 压力测试实战:CosBench揭示系统性能边界(一)14:13
-
视频:5-12 压力测试实战:CosBench揭示系统性能边界(二)14:34
-
视频:5-13 Python对接实战:开发面向DeepSeek的对象存储测试工具26:44
-
视频:5-14 Go语言实战:高性能测试与数据清理程序开发(一)17:24
-
视频:5-15 Go语言实战:高性能测试与数据清理程序开发(二)16:33
-
视频:5-16 AI训练对接实战:PyTorch直接读写对象存储数据16:31
-
视频:5-17 JuiceFS加速实战:为AI训练构建缓存加速层18:38
-
视频:5-18 本章回顾:对象存储核心能力与AI集成总结03:26
第6章 分布式存储集群中的块存储
9 节|117分钟
-
视频:6-1 块存储核心引擎解析:性能优化与架构设计05:25
-
视频:6-2 Ceph RBD深度解读:云计算的存储底层逻辑09:11
-
视频:6-3 存储池优化实战:数据与元数据分离架构16:21
-
视频:6-4 快照功能实战:实现块设备的高效数据保护15:02
-
视频:6-5 快速克隆实战:秒级复制TB级数据的奥秘14:13
-
视频:6-6 性能测试实战:FIO与VDBench工具深度使用18:40
-
视频:6-7 AI训练场景实战:K8s集群与块存储无缝对接(一)17:01
-
视频:6-8 AI训练场景实战:K8s集群与块存储无缝对接(二)16:56
-
视频:6-9 本章回顾:块存储在企业与AI场景中的应用总结03:55
第7章 实现PB级别的分布式文件存储
8 节|89分钟
-
视频:7-1 文件系统架构解析:共享存储与高性能访问04:13
-
视频:7-2 CephFS机制揭秘:突破容量与性能瓶颈的设计07:02
-
视频:7-3 分层存储实战:数据与元数据分离的高级配置11:08
-
视频:7-4 业务挂载与优化实战:参数调优与性能提升16:53
-
视频:7-5 JuiceFS vs CephFS:AI训练场景下的存储选型15:21
-
视频:7-6 企业级文件系统对比:CephFS、NFS、Samba全解析18:21
-
视频:7-7 AI训练直连实战:PyTorch与分布式文件系统无缝集成11:25
-
视频:7-8 本章回顾:PB级文件存储架构与AI适配总结04:18
第8章 分布式集群的监控搭建和管理运维
11 节|160分钟
-
视频:8-1 可观测性设计:监控体系构建的原则与方法06:01
-
视频:8-2 监控告警体系搭建实战:从原理到实现09:14
-
视频:8-3 Prometheus部署实战:云原生时序数据存储方案11:58
-
视频:8-4 Grafana可视化实战:打造业务监控全景看板13:40
-
视频:8-5 节点监控实战:Node Exporter部署与数据采集 (一)17:04
-
视频:8-6 节点监控实战:Node Exporter部署与数据采集(二)17:38
-
视频:8-7 业务监控实战:MGR模块数据导出与分析14:58
-
视频:8-8 集群指标采集实战:Ceph Exporter集成与配置10:29
-
视频:8-9 告警通知实战:Alertmanager多通道告警策略30:41
-
视频:8-10 自定义监控实战:Shell脚本采集与推送指标23:41
-
视频:8-11 本章回顾:分布式存储监控体系全栈总结04:09
第9章 分布式存储系统集群调优
9 节|122分钟
-
视频:9-1 性能分析方法论:从监控到调优的系统路径05:56
-
视频:9-2 调优必要性分析:理解系统软硬件性能边界04:19
-
视频:9-3 网络调优实战:万兆环境下的传输优化策略(一)16:01
-
视频:9-4 网络调优实战:万兆环境下的传输优化策略(二)17:17
-
视频:9-5 系统稳定性调优:内核参数与资源限制优化(一)21:27
-
视频:9-6 系统稳定性调优:内核参数与资源限制优化(二)12:56
-
视频:9-7 OSD参数调优实战:性能与稳定的平衡艺术22:09
-
视频:9-8 数据安全调优:Scrub机制原理与参数建议18:14
-
视频:9-9 本章回顾:集群性能优化关键点总结02:45
第10章 生产级分布式存储集群中常见的故障问题处理及排查
13 节|224分钟
-
视频:10-1 故障处理工程实践:方法论与应急流程09:41
-
视频:10-2 告警响应策略:从告警到处置的标准化路径08:06
-
视频:10-3 磁盘故障处理:OSD坏盘替换与数据重建22:34
-
视频:10-4 服务中断应急:Monitor宕机恢复方案14:20
-
视频:10-5 网络变更规划:集群IP迁移与配置更新27:12
-
视频:10-6 存储资源规划:集群扩容与缩容操作指南16:56
-
视频:10-7 多盘损坏应急:超越副本容忍度的数据恢复26:15
-
视频:10-8 写入过载处理:OSD Full状态应急与预防29:26
-
视频:10-9 高级调试手法:Ceph源码编译与机制探析18:23
-
视频:10-10 数据恢复:操作系统重装后的OSD快速恢复(一)14:33
-
视频:10-11 数据恢复:操作系统重装后的OSD快速恢复(二)13:26
-
视频:10-12 故障排查经验集:常见问题分类与处理思路20:06
-
视频:10-13 本章回顾:故障处理与运维实战能力总结02:08
第11章 DeepSeek推理大模型在分布式集群的应用
6 节|78分钟
-
视频:11-1 DeepSeek大模型解析:推理架构与运行原理09:49
-
视频:11-2 私有化AI助手部署实战:5分钟快速安装指南16:24
-
视频:11-3 专属知识库构建实战:基于分布式存储的模型微调15:42
-
视频:11-4 AI运维系统实战:打造智能日志分析与异常检测平台12:45
-
视频:11-5 智能磁盘预警实战:训练基于大模型的故障预测系统18:03
-
视频:11-6 本章回顾:存储与AI融合创新的未来展望04:45
第12章 AI+Ceph分布式存储工程实战–课程总结
1 节|12分钟
-
视频:12-1 AI+Ceph分布式存储工程实战–课程总结11:08
本课程已完结
阅读全文
常见问题
是否支持单个资源购买?
答:点击“立即购买”,即是单个资源购买。
开通VIP会员后,是否支持全部资源下载,如何开通VIP会员?
答:点击“升级VIP”按钮,支付完成后即可开通VIP会员,VIP会员支持全站课程免费下载。
链接失效怎么办?
答:联系客服QQ:630965719,获取最新下载链接。
原文链接:https://www.itspxx.com/qyjs/dmx/3693/,转载请注明出处。



评论0