YM博客 - 技术文章

Pai-Megatron-Patch:一款大模型训练加速工具

AI Agent 中的隐空间通信

Watchdog:系统稳定性的“隐形守护者”

DINOv3

Gradient Harmonizing Mechanism Loss(GHM Loss)

肯德尔系数(Kendall's Tau):衡量排序一致性的稳健利器

PPO(近端策略优化)中的4个核心模型

Self-Distilled OPSD

Self-Play DPO:让大模型"左右互搏"实现自我进化的强化学习新范式

gevent:用同步的方式写异步的代码

Composer 模式:一种 Agentic(智能体)工作模式

Coding Agent(AI 编程智能体)

关于 The AI-Native SDLC playbook

Langfuse 深度解析:开源 LLM 可观测性平台的技术全景

TokenMixer-Large:字节跳动推荐系统大模型的Scaling Up之路

深入解析 OpenTelemetry:云原生可观测性的统一标准与前沿演进

EvoTrainer论文详细总结

Agentic RL:当强化学习遇上自主智能体

MOON:基于生成式MLLM的电商多模态表征学习新范式

AI Agent 核心概念

LLM 关键词

Agent中的“Swarm”(蜂群)

通用Agent(General-Purpose Agent)常见问题

深入理解 Python asyncio:从原理到实战

Kubernetes 全面解读:云原生时代的容器编排之王

RQVAE如何防止码本坍缩

STEM (Scaling Transformers with Embedding Modules)

快手 Generative Auto‑Bidding with Value‑Guided Explorations(GAVE)论文总结

Agent 编排:从单体智能到系统化协作

Agent Trajectory:智能体轨迹的核心概念与工程价值

GRPO算法面试题大全(附答案)

受限波束搜索(Constrained Beam Search)

生成式召回语义编码中提高码本利用率的方案

Scaleformer:迭代多尺度细化的时间序列预测Transformer框架

ProbSparse 自注意力机制详解

受限解码

Sinkhorn 均衡分配

局部敏感度哈希

AI4PDE:当深度学习遇上偏微分方程,科学计算的范式革命

torch.nn.init.constant_

EverOS:为 AI Agent 打造本地优先、Markdown 原生的通用记忆层

Agent 记忆系统深度解析:Formation / Evolution / Retrieval

torch.norm、torch.linalg.norm

PyMuPDF:一个基于 C 语言库 MuPDF 构建的高性能 Python 库

GGUF(GPT-Generated Unified Format)

大语言模型(LLM)的推理服务中的连续批处理(Continuous Batching)

YaRN(Yet another RoPE extensioN)

Qwen2.5-VL 关键技术点深度解析

Temperature参数:大模型输出多样性的“创造力调节器”

大语言模型(LLM)中的Reject Sampling(拒绝采样)