- 相关博文
- 最新资讯
-
SpringBoot 整合机器学习框架 Weka 实战操作详解
-
git本地仓库的基本操作
-
HBase数据库不同于一般的数据库,如MySQL数据库和Oracle数据库是基于行进行数据的存储,而HBase则是基于列进行数据的存储,这样的话,HBase就可以随着存储数据的不断增加而实时动态的增加列,从而满足Spark计算框架可以实时的将处理好的数据存储到HBase数据库中的需求。从上述返回结果可看到,Hive中包含hive_hbase_emp_table表,HBase中包含hbase_emp_table表,说明Hive与HBase整合成功后,可以在Hive中创建与HBase相关联的表。
-
若要搭建多节点环境(如大数据集群),可先对已有虚拟机进行克隆,并将克隆后的虚拟机放在同一个文件夹下,方便管理。(并修改主机名,如下图,建议修改规律有顺序的名字,不影响后续记混乱)
-
最终需要得到一个类对象,而这需要内存来存放,因此需要分配内存空间,根据刚才读取到的内容,确定出类对象需要的内存空间,申请这样的内存空间,并且把内存空间中所有的内容,都初始化为0。魔幻数字,计算机圈子中约定俗成的做法,二进制文件中,会在开头的若干个字节,设置一个固定的常熟进去,通过这个常数,标识当前这个文件是什么样的文件。防止用户自己写的类,把标准库的类给覆盖掉,保证标准库的类,被加载的类优先级是最高的,扩展库其次,第三方库的优先级最低。谈到地址就是“内存”的地址,而文件(硬盘)中没有地址的概念。
-
Elastic推出AI Agent Builder功能,将生成式AI与搜索平台深度整合。该功能基于五大核心支柱:Agents定义目标、Tools提供能力、开放标准确保互操作性、评估确保透明度、安全提供信任。开发者可通过简单API创建自定义AI代理和工具,利用Elasticsearch的向量搜索和数据处理能力。平台支持MCP、A2A等开放协议,并提供完整的执行追踪和评估功能,同时继承Elastic原有的安全控制机制。这一创新使开发者能够快速构建基于企业数据的智能代理系统,实现对话式AI和工作流自动化。
-
【摘要】内网Kafka集群无法直接对外提供服务,通过Nginx反向代理实现间接访问时,发现Kafka元数据返回的内网地址导致连接失败。解决方案是:1)Nginx配置TCP代理,为每个broker设置独立端口;2)客户端修改hosts文件,将所有broker域名指向Nginx;3)增加IP白名单控制。该方案虽解决了测试环境问题,但存在维护性差(需手动维护hosts)、扩展困难等缺陷,仅适合临时测试使用。实践过程中深入理解了Kafka通信机制和Nginx流模块的应用。
-
本工具针对GIS矢量数据中的空洞检测问题。具备微小缓冲处理、环闭合检查和几何清理等核心功能,支持自定义容差参数,有效识别各类空洞(包括细微缝隙)。通过优化空间索引和批量处理技术提升大数据量处理效率,适用于国土规划等领域的数据质量检查。工具可免费使用,未来计划增加按最大公共边、面积、距离等权重自动修复空洞的功能。
-
摘要:主流开源数据湖格式对比分析 本文对比了三种主流开源数据湖格式(Iceberg、Delta Lake、Paimon)的核心原理与实现差异。
-
本文详细介绍了Hadoop单节点安装与配置流程。首先检查并安装JDK17等前置条件,提供两种Hadoop下载方式(WinSCP传输或wget下载)。接着解压文件并配置环境变量,重点讲解了四个核心配置文件的修改:core-site.xml设置HDFS地址、hdfs-site.xml配置数据目录、mapred-site.xml启用YARN框架、yarn-site.xml配置节点管理。最后通过格式化HDFS、启动服务、运行测试作业和访问Web界面(9870/8088端口)验证安装成功。文中特别强调将Hadoop安
-
从基础内存分配到实战避坑,一篇搞懂 C++ 内存管理关键,告别泄漏与野指针。
-
linux - ubuntu22.04安装Erlang和rabbitmq(生产机)
-
linux-安装RabbitMQ并启动
-
最近在进行大规模数据任务从MapReduce向Spark3迁移的工作,遇到了一个典型的数据倾斜案例。本文将分享这个案例的具体情况、问题分析思路以及最终的解决方案,为类似场景的优化提供参考。
-
Flink的Watermark机制通过用户定义策略来估算事件时间进度,其核心是开发者与系统间的契约。WatermarkGenerator组件负责生成Watermark,支持单调递增和有界乱序两种主要策略。当Watermark(t)发出时,系统认为不会再有更早的事件到达,这种保证基于用户对数据特性的假设。若事件迟到超过阈值将被丢弃,但可通过allowedLateness处理。最终Watermark.MAX_WATERMARK能确保所有事件处理完毕。该机制本质上是启发式的,其可靠性取决于开发者对数据流特性的掌握
-
文章摘要: 本文探讨了企业制定ODX数据库编写指南(AGL)的必要性。作者结合十余年车载诊断经验,对比了CDD/ODX/DEXT三种诊断数据库的优劣,指出标准ODX因灵活性过高导致建模方式不统一、工具链兼容性差等问题。企业制定AGL可统一诊断数据规范(如命名规则、建模方式)、提升开发效率、保障跨部门协作,并降低工具依赖风险。AGL通常包含建模规则、命名约定、内容约束、用例模板等核心内容,相当于为企业内部诊断数据建立"标准语法",确保数据一致性和可维护性。文章通过类比英语写作规范,生动说明
-
RepoWiki是Qoder平台的智能文档生成功能,通过静态代码分析自动提取项目架构、模块依赖和核心逻辑,并持续追踪代码变更保持文档同步。其工作流程分为四个阶段:1)代码扫描与AST解析;2)结构分析与依赖映射;3)文档智能生成;4)增量更新机制。支持多种编程语言,能识别设计模式并推断技术决策,适用于新项目搭建和遗留系统维护。优势在于降低理解成本和提高开发效率,但存在文件数量限制和依赖Git的局限性。典型应用场景包括自动生成架构图、API手册和团队知识沉淀。
-
由亿万个节点和边组成的数字化社交网络中。每一条互动、每一条评论、每一次转发,都在产生海量数据——据统计,仅微信每天就有超过450亿条消息发送,抖音日均视频播放量超300亿次。为什么有些内容能瞬间刷爆朋友圈?你身边的“隐形圈子”是如何形成的?谁是真正能影响他人决策的“意见领袖”?数据挖掘(Data Mining)就是破解这些密码的“钥匙”。它能从社交网络的海量、多源、动态数据中,提取出有价值的模式与知识,帮助我们理解社交行为的规律、预测趋势,并优化产品与服务。用“朋友圈的圈子”理解社交网络的结构。
-
Feign 远程调用属于同步调用。例如:用户支付并调用支付服务(用户付款成功),需要依次调用多个服务(订单服务(更新订单状态)、短信服务(短信通知用户)、积分服务(增加用户积分)等)。缺点性能下降。消费者需要等待所有提供者依次执行完成。级联失败。如果提供者出现故障,则消费者同样出现故障。耦合度高。如果新增业务需求,则需修改原有代码。优点时效性高。可以立即得到结果。适用场景时效性高的场景。例如:在查询订单时,同时查询用户信息。
-
在海量数据与复杂查询场景下,Apache Doris 的性能有时候并不能达到预期,这时候就需要通过系统性调优匹配业务需求。本文将梳理从问题定位到引擎优化的全流程方法,帮助开发者精准挖掘系统性能潜能

-
近日,阿里云对外宣布其容器服务调度GPU云服务器启动加速计算,最快只需60秒即可完成新冠病毒的核酸对比工作;同时将向医疗科研机构、疾控中心等一线病毒研究机构免费开放基因计算服务,技术可大幅提升宏基因组测序、疫苗研发相关的处理效率。基于此,晶少专程采访了阿里云基因计算服务AGS负责人、高级技术专家李鹏,集中呈现针对GPU和容器技术大幅提升核酸比对速度的有关细节以及关于阿里云基因计算服务(AGS)的诸多信息。
-
日前,ASPLOS 2020公布了计算机界最新科技成果,其中包括阿里云提交的名为《High-density Multi-tenant Bare-metal Cloud》的论文,该论文阐述了阿里云自研的神龙服务器架构如何解决困扰云计算行业多年的虚拟化性能损耗问题,打破物理机的性能神话,让云服务器突破性能极限。
-
让服务器突破性能极限 阿里云神龙论文入选计算机顶会ASPLOS
日前,ASPLOS 2020公布了计算机界最新科技成果,其中包括阿里云提交的名为《High-density Multi-tenant Bare-metal Cloud》的论文,该论文阐述了阿里云自研的神龙服务器架构如何解决困扰云计算行业多年的虚拟化性能损耗问题,打破物理机的性能神话,让云服务器突破性能极限。此次入选意味着全球计算机顶会对阿里云自研技术的认可,也意味着中国创新技术在全球计算机界争得了一席之地。
-
在线教育如何应对流量洪峰?阿里云专家:上云+云数据库是最佳路径
2月中下旬原本是全国各地春季学期开学的日子,但这场突如其来的疫情使得1.8亿中小学生只能纷纷在家开启“停课不停学”的学习生活,而线上教育也顺势成为了这一特殊时期首选的学习方式。
-
2月18日,阿里云在官网宣布,河源数据中心正式对外提供服务。这是华南地区规模最大的绿色数据中心,可容纳超过30万台服务器,作为深圳地域的新可用区为华南地区上百万企业客户提供领先的云计算、人工智能、物联网等服务。
-
2月12日,钉钉已连续在苹果应用商店霸榜7天。记者采访获悉,春节以来,在家办公及在家上课的强需求,使得钉钉后台系统峰值流量暴增百倍。钉钉通过阿里云连续扩容10万台云服务器,成功抗住这一巨大的流量冲击!
-
2月3日是一个特殊的开工日,为防范疫情,在阿里巴巴钉钉上有超过1000万家企业组织的2亿上班族在线开工。为支持此次史无前例的办公需求,钉钉在阿里云上紧急扩容1万台云服务器来保障钉钉视频会议、群直播、办公协同等功能,保障用户流畅体验。
-
云改变了IT业态和市场格局,催生了应用大发展的时代,企业可以更加专注于构建符合其愿景的、更具生命力的业务创新。全面使用云服务构建软件的时代已经到来,在这个大背景下,云原生的概念被提出并迅速具象化,而以容器为代表的云原生技术,作为提升云化服务能力的最佳选择,也得以快速发展。
-
雅士利牵手阿里云实现新零售改造,双11全渠道成交金额同比增长超过200%
12月3日在阿里云峰会·广州站上,雅士利分享了与阿里云的合作,借助数据中台实现新零售改造。在刚刚结束的天猫双11中,雅士利旗舰店整体线上交易同比增长超3倍,旗下羊奶粉品牌“朵拉小羊”50秒成交额超越618全天成交总额,朵拉小羊3段成交订单全网第一,消费者资产实现10倍增长。
-
12月3日,广东省农村信用社联合社银信中心副总裁周丹在2019年阿里云广东峰会上透露,通过携手阿里云,广东农信实现了从传统架构向云化的转型升级,金融业务系统的搭建工期从按月计算缩短至按天计算,效率大幅提升。
-
12月3日,广州云峰会上,阿里云宣布推出面向混合云场景的CPFS一体机和视觉AI一体机,两款新品具备超高性能、开箱即用等特性,极大降低企业上云的周期和门槛。加上此前推出的POLARDB数据库一体机和蚂蚁mPaaS一体机,阿里云已为客户提供了四款一体机家族产品,集结了云、网、边、端一体化的能力,打破云的边界,让企业能够随时随地全栈、全态、甚至全域上云。
-
阿里云提出“云+Fintech”新金融战略 已助上万家金融机构上云
12月3日,阿里云峰会广东期间,阿里巴巴副总裁、阿里云智能数字政府事业部总裁许诗军表示,目前阿里云已成为中国数字政府大数据整体市场第一,也是数字政府大数据基础平台软件市场第一。
-
12月3日,阿里云峰会广东期间,阿里巴巴副总裁、阿里云智能数字政府事业部总裁许诗军表示,目前阿里云已成为中国数字政府大数据整体市场第一,也是数字政府大数据基础平台软件市场第一。
-
12月3日,在阿里云广东峰会上,阿里云联合超图软件、长光卫星、Maxar技术、四维测绘等顶级卫星影像产业链公司发布数字地球引擎,提供开放式的影像数据集、遥感AI能力、丰富的API接口等,在国土资源监管、水利河道治理、自然环境保护和农业估产等领域帮助政府和企业提升效率。
-
12月3日,阿里云广东峰会期间,大横琴科技公司联合阿里云发布了全国首个跨境服务创新平台。基于该平台,全国首个跨境服务APP“琴澳通”也正式发布。“琴澳通”将为澳门企业及个人提供服务,推动澳门和广东两地的产业经济联动,数字化升级。
-
“我们希望帮助工厂从原来的单点变成全产业链、全价值链、全要素的融合,变成数字化智能化的工厂,并为工业产品带来智能化。”库伟表示。
-
12月3日,在2019阿里云广东峰会上,阿里云智能总裁张建锋表示,全面迈入数字经济时代,数据成为社会经济发展的新生产要素,云智能是新基础设施。
-
11月28日,阿里云正式开源机器学习平台 Alink,这也是全球首个批流一体的算法平台,旨在降低算法开发门槛,帮助开发者掌握机器学习的生命全周期。
-
近日,开源数据库厂商MongoDB与阿里云在北京达成战略合作,作为合作的第一步,最新版MongoDB 4.2数据库产品正式上线阿里云平台。
-
CSDN云计算「C课有道」栏目趁着这股技术风潮再次如期而至啦!秉承「门门有路,路路有门」的理念,这次CSDN云计算小分队特邀阿里云、腾讯云、青云、天云等企业内的“国宝级”架构师,共同打造了一款数据库系列进阶教程,效果绝堪比“红宝书”。 从数据库宏观发展入手,内容主要涉及云数据库为代表的非关系型数据库、MySQL数据处理、分布式等诸多技术要点,将造福开发者设置为终极指标,纯技术绽放的精彩无限,实在不容错过。
