- 相关博文
- 最新资讯
-
本文介绍 Delta Lake 与 Flink 集成的核心方法,重点讲解流式写入 Delta 表的技术实现和延迟优化策略,通过实际示例展示如何提升流处理系统的性能和效率。
-
AgentOps Lite 一个自己在做 邀请开源的agent治理平台
-
本文记录了在双台DGX Spark(GB10)上部署与优化大模型的完整实践:从Qwen3.8-27B单机SGLang部署(56 tok/s,256K上下文)到双机TP=2全链路验证,性能提升35–45%;进而成功运行284B参数的DeepSeek-V4-Flash-0731,实现73 tok/s吞吐与1M上下文长文检索。实测揭示三大反直觉结论:双机非线性提速、NVFP4权重无免费午餐、高GPU利用率仅耗42W。关键在于RoCE链路配置(MTU 9000、NCCL_GID_INDEX自动探测)、内存管理优化及
-
2026 年 9 月 18 日凌晨,独立开发者 ferstar 清理磁盘时,发现 ~/.zcode 异常占了 700 多 MB。顺着这条线索,他还原出一条链路:智谱官方 AI 编程客户端 ZCode 在登录状态下,会把整个工作区打包加密、直传阿里云 OSS。快照里 .git 占了 86.6%,完整开发历史都在里面,包括删过的密钥和没推送的分支,而解密私钥只在智谱服务端。
-
本文记录百分考在单企业百万题库背景下,采用双 Nginx 与 5 个应用实例完成的 3 万人考试业务 HTTP 全链路压测。考生在 60 秒内登记入场,单轮产生 171 万个核心请求,包含 150 万次答案保存;HTTP 峰值约 15800 RPS,固定卷答案保存 P95 为 48.6ms。文章结合负载分发、共享服务水位与节点故障验证,分析多实例扩容的实际效果。
-
本文详细探讨了 Spark 与 Hive 的两种主要集成方式:Spark on Hive 和 Hive on Spark,以及它们在元数据管理上的差异。文章从工作原理、配置方法、性能对比和实际应用场景等多个维度进行分析,帮助读者选择适合自己业务需求的集成方案。
-
本文详细对比分析了Spark中三种主流Join策略:Broadcast Hash Join、Sort Merge Join与Shuffled Hash Join的实现原理、适用场景及性能特点。通过理论结合实践的方式,帮助读者理解不同Join策略的优缺点,掌握针对不同数据规模和数据分布的Join优化方法,从而提升大数据查询性能。
-
纯向量检索在企业级大数据场景中因无法处理复杂关系与多跳推理而失效。本文提出GraphRAG与AIAgent融合架构,通过知识图谱构建实体拓扑、多智能体协同推理与反思校验机制,实现百亿级异构数据下的精准因果推断。实测表明,该方案将幻觉率从31.5%降至5.2%,成功解决供应链风控等复杂业务问题,为智能体落地提供可扩展、高可用的技术范式。
-
BigTop 3.6编译
-
本文介绍一款支持多数据库类型(如PG、MySQL、Neo4j、ES等)的AI驱动数据迁移工具,具备全量同步、增量迁移、智能字段映射与断点续传四大核心能力。基于Go引擎实现流式传输与并行调度,适用于复杂异构数据场景。作者通过四阶段实践:提示词→提示工程→AI智能体编排→人工纠错,逐步实现自动化数据流动。适合需跨库、大容量、实时同步的开发者与运维人员。
-
在Amazon跨境电商场景中,企业级数字员工系统需超越单一Agent的“任务执行”能力,转向持续履职、协同工作并以真实业务结果评价的岗位化体系。通过定义角色(如运营主管、广告优化师、库存计划员)、拆解核心技能(如异常诊断、预算优化)、构建以任务驱动的闭环流程(任务→决策→行动→结果→评估),将企业SOP转化为可复用的AI能力。关键在于以“任务”为核心枢纽,打通调度、执行与评价链路,实现从“会调用工具”到“承担岗位职责”的跃迁,真正构建可规模化、可迭代的企业数字劳动力。
-
系列:《Cloud GIDO 三产品特性深讲》第 15/15 篇(第一季完)标签:学习路径、动手验证、开源、Flink、事件治理。
-
本文介绍了openEuler 22.03 LTS环境下OpenStack部署的前置配置:通过华为云源替换YUM源并清理缓存;设置主机名为controller,配置hosts文件;安装MariaDB数据库,修改配置文件绑定本机IP,启动服务并设置开机自启;最后通过mysql_secure_installation配置root密码,完成环境初始化。
-
本文系统梳理了ysyx-workbench与讲义的对应关系,涵盖工程初始化、NEMU架构(riscv32 ISA配置、启动路径、CPU执行流程、内存设备模拟)、抽象机器层(AM)设计、测试程序验证及FCEUX移植应用。重点强调身份信息核对、ISA一致性、trap机制规范性、调试输出控制与实验心得记录。推荐按顺序阅读关键文件,深入理解软硬件接口与系统细节,确保符合讲义要求的“白手装机”与“随时记录”原则。
-
核心:业务和消息同库同事务 → 投递器扫表发 MQ → confirm 确认 → 租约回收 → 死信人工兜底。1.2 实体类1.3 Mapper 接口1.4 Mapper XML1.5 业务侧:业务 + outbox 同事务1.6 投递器1.7 回收器1.8 RabbitMQ 配置1.9 生产者死信监控投递器重试用尽后,记录变成 。它不会自己恢复,需要监控告警提醒人工处理。监控频率不能太频繁,避免重复告警骚扰。策略:为什么这样设计:生产者死信不是 MQ 里的消息,而是数据库
-
本文通过对比Python与Hadoop MapReduce在5000和10000站点规模下的相关系数计算任务,量化了工具选型的“盈亏平衡点”——约7812站。实验发现:5k时Python快56%,10k时MR反超22%,但并非因并行优势,而是固定开销与计算成本此消彼长所致。揭示大数据技术栈分层本质:底层依赖Java/Scala保障系统性能,应用层则以Python实现高效开发。该实验为小批量任务的工程选型提供了可量化的决策依据。
-
本文复盘了一体化自动化测试平台从0到1的搭建实践,涵盖架构设计、技术选型与关键决策。平台整合接口测试、长连接协议、性能压测、功能测试、缺陷管理与AI辅助,采用前后端分离、分层解耦架构,通过Django+ASGI支撑多协议接入,利用Kafka/Elasticsearch实现高吞吐日志处理,Redis保障实时通信与缓存,独立执行器隔离压力。核心创新包括:HTTP/WebSocket共端口部署、单端登录鉴权、事件总线可插拔设计,最终实现测试资产统一管理、执行闭环与智能报告,显著提升测试效率与协作体验。
-
Elasticsearch 9.5 聚焦实际痛点,推出列存储模式(logsdb_columnar)显著降低日志磁盘占用,提升分析性能;向量搜索引入 vectordb_document 模式,实现开箱即用、自动调参,召回率与吞吐双提升;新增 semantic 字段支持跨模态检索,图片、PDF 等可直接语义搜索。同时原生 Prometheus 支持与观测能力增强,助力日志、指标、AI 一体化管理。建议新项目优先采用,老集群稳妥评估迁移,真正实现“省空间、少调参、能跨模态”。
-
【Perforce演讲回顾】本期聚焦版本控制软件P4在2026年的几大关键进展:包括P4 MCP 服务器、P4 REST API、稀疏流Sparse Stream以及待发布的新产品P4 Signals。
加载中...



















