C学社
AI Agent 真的会自主规划吗——从工具调用、闭环重规划到长程自治的系统归因审计
大模型真的会在上下文里学习吗——从任务识别、标签重绑定到临时算法的六层承重测试
LLM 真的在推理吗——Chain-of-Thought 的能力、计算、轨迹与证明承重测试