- 相关博文
- 最新资讯
-
本文介绍了 make 与 Makefile 在自动化构建中的核心作用。通过依赖关系与依赖方法,实现高效编译管理,避免重复编译。重点讲解了 Makefile 的基本语法、伪目标 .PHONY 的使用、文件时间比较机制及依赖链的推导逻辑。结合变量扩展,提升可维护性,助力大型项目高效构建。
-
DBKit 诞生的初衷,就是解决开发日常运维 “工具碎片化” 问题。很多时候我们排查问题,一会切数据库客户端,一会切 MQ 工具,来回复制 IP 账号,效率很低。DBKit 尝试把关系库 + 消息中间件整合到一个工作台。项目持续迭代中,后续计划:时序数据库支持、审计日志增强、SQL 性能分析等。如果你感兴趣,欢迎前往 Gitee 体验、提交 Issue,一起完善这个面向开发的本地运维工具。
-
ELK 的价值不在于单独安装三个组件,而在于把日志采集、索引存储和可视化分析串成一条完整链路。Elasticsearch 负责保存和检索数据,Logstash 负责接入与处理日志,Kibana 则提供查询、索引管理和图表展示。
-
本次学习的目标很简单:能独立完成本地代码的版本管理、能把本地代码同步上传到 Gitee 远程仓库、掌握最基础的分支操作,满足个人开发和简单备份的需求。写这篇博客一方面是自己做个学习复盘,把命令、操作步骤、踩过的坑都整理下来,方便以后忘了随时查在项目文件夹执行git init初始化仓库,生成.git隐藏文件夹编写 / 修改文件后,用git add 文件名或git add .将文件加入暂存区用git commit -m "提交说明"提交到本地仓库,生成一个历史版本用git log。
-
初次执行git init时没有提前切换目录,仓库直接创建在 C 盘桌面。解决:先 cd 进入 D 盘目标文件夹,再初始化仓库,方便统一管理文件。不清楚命令模式和编辑模式,直接输入内容会出错。操作要点:按i进入编辑模式;修改完成按Esc退出,输入:wq保存退出;yy复制,p粘贴。修改文件后,忘记执行git add就直接 commit。流程:修改文件 → git add 添加到暂存区 → git commit 提交本地库。撤销暂存使用git rm --cached 文件名。使用HEAD^
-
AllData搭建数据开发平台,集成开源项目Dinky/StreamPark/DolphinScheduler,涵盖实时计算/任务调度(一)
-
本文详细指导Hadoop三种模式(单机、伪分布、完全分布式)在Docker中的部署与切换。强调同一时间仅可运行一套环境,启动新环境前必须使用docker stop停止旧容器,避免端口冲突。操作流程包括:容器启停、SSH免密配置检查、网页访问验证(50070/8088)、进程查看(jps)及服务启停(start-all.sh/stop-all.sh)。关键提示:所有Docker命令在CentOS7宿主机执行,进入容器需用docker exec -it,且停止容器需等待回显。
-
本笔记梳理 Hive 三种主流存储文件格式 TEXTFILE、ORC、PARQUET,附带建表、数据导入、查询性能对比案例;同时完整讲解 Hive SELECT 查询全套语法,包含基础查询、字段别名、LIMIT、WHERE条件、运算符、聚合函数、GROUP BY与HAVING、多表JOIN连接、四类排序语句(ORDER BY、SORT BY、DISTRIBUTE BY、CLUSTER BY),配套emp/dept业务示例SQL,适合Hive查询语法学习、上机练习与期末复习。
-
大数据挖掘的挑战在于如何让算法在“大、快、杂、脏”的数据中,快速、准确、安全地发现价值;而处理框架的挑战在于如何构建一个可扩展、高可用、易用的分布式系统,为挖掘算法提供坚实的计算底座。
-
保护隐私的大数据交换正从“防泄露”走向“价值释放”;单一技术不够,需系统级组合与治理;未来属于“隐私原生”的数据要素基础设施。
-
Elastic荣获Gartner 2026《企业AI搜索魔力象限》领导者称号,执行能力与愿景完整性双领先。在配套《关键能力》报告中,其在AI自动化用例中排名第一,其余六大场景均位列第二。凭借强大的检索引擎、开源生态及对向量搜索的持续投入,Elastic为AI agent提供精准上下文,助力企业实现可规模化、低幻觉的AI应用落地。
-
本文整理 Hive 分区表核心知识点,分区表借助`PARTITIONED BY`定义分区字段,把数据按维度拆分存储,缩小查询扫描范围,提升查询性能。笔记讲解分区表建表语法,支持`LOAD DATA`、`INSERT`两种方式写入数据,包含查看、新增、删除分区等管理操作。当 HDFS 路径与 Hive 元数据不一致,可使用`MSCK REPAIR TABLE`修复同步。同时介绍二级分区实现多层数据划分,以及动态分区,动态分区可根据查询结果自动生成分区,需提前配置对应参数,区分严格与非严格两种运行模式。
-
本文整理Hive分桶表知识点,分桶表通过CLUSTERED BY指定分桶字段,按照哈希取模规则将数据拆分到指定数量桶文件中,优化抽样查询与表连接性能。笔记展示分桶表建表语法,给出学生表实操案例,使用LOAD DATA完成数据加载。同时介绍分桶排序表,在分桶基础上增加SORTED BY,让每个桶内数据预先排序,提升join查询效率。分桶和分区不同,分区是按目录划分,分桶是对文件内部数据划分,合理使用分桶可优化Hive大数据场景下的数据组织与查询性能。
-
“保护隐私的大数据交换”通常不是把原始数据搬来搬去,而是让多方在数据不出域 / 不可见的前提下完成联合计算、联合建模、统计发布或数据交易。它处在密码学、分布式学习、数据治理、经济学和法规合规的交叉点。下面按“模型—核心问题—未来方向”梳理。
-
本文从企业级开发模型与 DevOps 理念出发,分析开发、测试、预发布和生产环境的职责划分,并结合 Git Flow 讲解 master、release、develop、feature、hotfix 五类分支的设计目的与协作方式。随后通过不同环境下的 Bug 修复案例,演示测试环境、预发布环境与正式生产环境的修复流程,重点梳理线上紧急问题的 Hotfix 处理、分支合并与版本同步,建立规范、可追踪的企业级 Git 开发与发布工作流。
-
本文基于车联网TSP平台真实场景,剖析传统Lambda架构在实时与离线数据不一致、维护成本高、无法回算等痛点。针对行程主题数仓的三大核心需求——秒级实时看板、权威可回算离线报表、统一口径互不踩踏,提出以Flink 1.20 + Paimon 1.4 + Doris 4.1构建流批一体湖仓方案。通过Paimon统一存储底座实现数据幂等入湖、支持全链路重算,结合“实时先行、离线校准”设计,达成实时与离线最终一致且互不干扰,为生产环境落地提供可复用实践路径。
-
git相关命令总结
-
Unity Spark 并非“一句话生成游戏”的工具,而是面向非开发者(玩家、美术师、模组作者)的低门槛互动创作平台。它通过自然语言与素材拼接,在浏览器中快速构建可分享的游戏原型,强调“人”在创作中的核心作用。虽不能导出至桌面版 Unity或用于商业售卖,但其目标是打破游戏创作与消费的鸿沟,推动更多人进入 Unity 生态。技术上依托多模型生成与 Google Playground,未来或覆盖全平台。本质是“可编辑的生成式创作入口”,而非黑盒成品生成器。
-
本文详细介绍了在三台Anolis 7.9系统机器上搭建Hadoop集群的完整流程,包括主机名配置、hosts文件设置、用户创建与权限分配、防火墙及SELinux关闭、JDK 8安装,以及SSH免密登录配置。重点在master节点完成Hadoop 3.3.6的下载解压、环境变量配置和核心配置文件(core-site.xml、hdfs-site.xml、yarn-site.xml等)修改,并通过rsync分发至node1和node2。最后执行namenode格式化并启动HDFS与YARN服务,验证集群运行状态,
加载中...



















