"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning" 论文笔记
清华、浙大与美团 LongCat 团队合作的 AgentOPSD,目前挂在 Arxiv 26.08 上,做的是长程多轮 Agentic RL 里的回合级信用分配。可验证奖励的 RL 只在整条轨迹结束时给一个稀疏的 0/1 信号,GRPO 这类方法把轨迹级优势均匀广播到每个 token,无法把成败真正 ...
[AI/Agent/驾驭工程] DeepSeek Harness(dsh):一切皆插件的开源 Agent 运行时底座——未来AI Agent/Hardness工程领域的“Linux”
0 序 DSH 绝对创下了 Github 开源社区的历史之最,从2026.08.13发布至今短短半个月,已经获得 207K star(截止于2026.09.01笔者写下这句话时),且每天仍以几千的速度狂揽 star。这种极致开放的架构、及DeepSeek这种极致开放的公司理念,真的是把开源社群的优势 ...
Hermes Agent v0.21.0:从工具箱到协作团队
如果只看一个重点:Hermes Agent v0.21.0(v2026.8.31)已经不是给单个助手加几个新工具,而是把多个 Agent、定时任务、子任务、MCP 服务、桌面浏览器和审批安全,真正拼成了一个能协作、能记住上下文、能被中途指挥的工作台。 我本机现在还在用 Hermes Agent v0 ...
Graph RAG,不一定要图数据库
常规路径和它的代价 Graph RAG 的主流做法大致分三步:部署图数据库,写 ETL pipeline 把文档灌进去,跑实体抽取和关系挖掘,建出知识图谱,再做图检索。HippoRAG 的知识图谱就是这么来的,Graphiti 和 Zep 维护的 temporal graph 走的也是这条路。 对一 ...
别急着翻译 SKILL.md:我做了一个专门拆解 Skill 设计的工具
别急着翻译 SKILL.md:我做了一个专门拆解 Skill 设计的工具 第一次打开一份复杂的 SKILL.md,很多人的反应都是从头往下读。 每句话似乎都认识,连在一起却不一定明白:为什么这里用了 MUST?为什么执行前要读取这些文件?状态由谁维护?AI 做到什么程度才算完成?如果两条指令发生冲突 ...
当 360° 全景遇上真实地图:Vue 3 实现全景-地图双向联动的工程实践
一、要解决的问题 虚拟漫游(街景、景区导览、看房)里常见一个需求:用户既能在 360° 全景里环顾四周,又能在小地图上知道"我现在朝哪、标记在哪个方位"。两个视图还要双向联动——点地图上的热点,全景自动转过去;点全景里的标记,地图高亮对应位置。 本文以一个纯前端实现为例,拆解其中的数学原理、第三方库 ...
OpenSpace:Agent 真正该进化的是 Skill 层
Agent 的能力不只来自模型,也来自外部 Skill 层。OpenSpace 的价值在于把 Skill 做成可记录、可验证、可分级、可回滚的系统,让任务经验能在下一次执行中被复用。 ...
Java并发锁与缓存实战核心总结
Java并发锁与缓存实战核心总结 本文整合日常开发、面试高频的Java锁机制、本地/分布式缓存选型、缓存经典问题、布隆过滤器核心知识点,剔除冗余内容,只保留实战可用、面试必背的干货,适合收藏复习。 一、Java核心锁机制(开发高频) 1. synchronized(内置锁,优先使用) JVM层面实现 ...
高并发下的抢红包设计:微信红包背后的算法与温情
本文拆解微信拼手气红包高并发实现,详解核心**二倍均值算法**,解决红包分配公平性问题。架构上依靠 Redis+Lua 脚本实现原子抢红包,规避超发与重复抢夺;结合 MQ 异步落库、热点 key 拆分、多层限流、定时对账兜底,支撑百万 QPS。给出 Java、Lua 核心源码,梳理超发、缓存一致性、... ...
RSA 密码传输加密通用接入方案
@目录前言一、介绍二、RSA 在本方案中的角色三、密文协议格式四、密钥生成与 Apollo 配置4.1 编译工具类4.2 执行生成密钥4.3 执行输出示例4.4 Apollo 配置示例五、后端接入方式AOP 注解示例六、后端解密流程七、前端接入方式7.1 获取公钥和 nonce7.2 使用 RSA- ...
每次开工先付的那笔钱,你知道有多少吗:省 token 故事 · 叠床架屋
叠床架屋,说的是床上再叠一张床,屋顶上再架一间屋。 不是不能用。 是白搭一层。 上一篇那句判据在这儿正好用得上:这一步是不是每次都要发生? 写在常驻位的东西,每次开工都要付一遍。一份两千字的规矩挂在那儿,跟你每次提问前先朗诵一遍是一回事。所以该按需加载的东西放进了常驻位,这是确定在浪费,不用测。 那 ...
MHS 三部曲(中):8 小时集成、六种被拦截的故障,和一次教科书级的翻车
四个案例合起来说明三件事:接入与编排成本可以数量级下降(CMU/Janelia),闭环试错和跨设备补救是真的(CMU/Tetsuwan),但物理直觉仍是硬伤(Genentech),安全必须长在模型之外。 ...
从一条订单消息到 Bronze、Silver、Gold:我的第一次 Kafka + Lakehouse 实验
作为 Oracle DBA,笔者熟悉表、事务、Redo、SCN 和数据仓库;但第一次面对 Kafka、Topic、Partition、Offset 与 Bronze、Silver、Gold 时,仍觉得概念很多、关系不清。于是笔者用 6 条订单事件跑通了一条最小链路。 graph TD Oracle( ...
OSS 文件上传的几个风险点和解决方案
〇、前言 OSS 作为海量数据的承载平台,一旦配置不当,可能引发敏感数据泄露、恶意文件上传、巨额流量盗刷甚至数据被勒索加密等严重后果。 了解这些风险并非杞人忧天,而是帮助开发者和运维人员在使用 OSS 时建立正确的安全思维——从凭证管理、权限控制、访问策略到上传校验,每一个环节都可能在疏忽中成为攻击 ...
轻量化小模型MiniMind从训练到落地指南
本文基于 Ubuntu 22.04 服务器环境,依托 NVIDIA RTX 家用高性能显卡,手把手讲解 MiniMind 轻量大语言模型从零搭建、数据集部署、全流程训练、可视化Web服务搭建及GGUF格式量化的完整实操方案。全程摒弃复杂高阶封装,基于原生 PyTorch 实现,适配个人开发者、人工智... ...
一文入门 Apache Cassandra
Apache Cassandra 官页 - https://cassandra.apache.org/_/index.html 官中文档- https://cassandra.apache.ac.cn/doc/latest/cassandra/getting-started/index.html W ...
【Agentic RL / 强化学习框架】Molt 设计解读
【Agentic RL / 强化学习框架】Molt 设计解读 目录【Agentic RL / 强化学习框架】Molt 设计解读0x00 概要0x01 从 RL 流程到 Molt 代码:一次完整映射1.1 第一层:标准 RL 训练流程1.2 第二层:Molt 模块对应关系1.3 第三层:类定义 + 角 ...
【Azure Redis】中国区创建和连接 Azure Managed Redis 的两个注意事项
Azure Managed Redis 介绍 Azure Managed Redis 是微软新一代全托管 Redis 服务,基于 Redis Enterprise 构建,为现代云应用提供低延迟、高吞吐的数据访问能力。相比传统 Azure Cache for Redis,它采用更高效的多分片架构,并提 ...
OpenClaw 2.0 发布:史上最大更新,8 大新功能 + 2 个破坏性变更必看
38 万 star 的个人 AI 助理 OpenClaw 今天发布 2026.8.1——也就是官方口径的 OpenClaw 2.0,史上最大更新:933 位贡献者、16000+ 个 PR,会话搜索、云端工作节点、私密凭据请求等 8 大更新落地,但有 2 个破坏性变更——升级前必须先备份,再跑 ope ...
【手搓 Agent 第2.3关-上】搭建 Agent 进阶能力:File I/O 文件读写工具
本篇依托新的工具注册中心,从零实现一套高安全、多格式适配的 File I/O 文件读写工具,让 Agent 拥有专属“书写能力”,补齐智能体内容落地的关键短板。 ...


