This section will collect technical notes, research reflections, and essays on AI systems and engineering. The goal is writing that is practical and worth returning to — not frequent posts for their own sake.
公开两篇 2607 论文的 PDF→Markdown→中文 PDF 工程:保留页级坐标、公式与代码对象,留下结构/文本/视觉 QA 证据,并明确机器译稿的边界。
Notes on building reliable multi-agent workflows — memory management, tool orchestration, failure recovery, and evaluation.
How I approach literature synthesis, experiment tracking, and turning vague research questions into executable systems.
Practical notes on applying machine learning to industrial optimization problems — what works, what doesn't, and why.
First posts coming soon. Subscribe via GitHub or check back here.
从 Lilian Weng 的 Harness Engineering 出发,讲清楚上下文工程、工作流搜索与 harness 自我修改各自如何工作,现有证据支持到哪一步,以及距离真正的递归自我改进还差什么。
梳理 EvoTool、GEPA、SPRIG、EvoSkill、SkillMOO 等工作,讨论遗传/进化算法如何优化 tool-use policy,并提出 Causal-Pareto Tool Evolution 作为面向长链路 agent 的研究方案。
比较 OpenAI、Anthropic、Gemini、DeepSeek、Mistral、xAI、Qwen、Cohere 的工具调用模式,并说明为什么 tool use 的关键不是 JSON,而是执行循环、状态回填和评测边界。
基于一条抖音视频口播稿,拆解 SCI 写作的模块化套路、真正卡住研究生的四座山,以及 AI agents 在选题、文献综述、数据分析和初稿生成中的合理位置。
记录一次把硅基流动 GLM-5.1 接入 Codex/Wecode 类 harness 的真实排障过程,并分析 Responses API 与 Chat Completions API 在 agent 系统里的协议边界。
记录 2026/04/30 这次更高分提交:从 373/445 到 392/445,以及背后的 agent harness 工程、trace 分析、错题闭环和同一个 Hugging Face PR 替换提交。
记录一次 Wecode GPT-5.5 leaderboard submission 的完整工程过程:跑分、误差范围、metadata、trajectory、system prompt 清理、目录结构和 PR 提交。
基于一个高质量 GitHub prompt 仓库,整理出人像、海报、角色设定和 UI/信息图四类最值得复用的写法,并补上可直接改的中文模板。
基于 tbench.ai、Harbor 与 Hugging Face 官方说明,纠正上一版不准确的任务清单,并补齐运行、结果文件与提交要求。