研究与基准测试/2026-09-28/11 分钟计划先定死再写:美团 LongCat 用 ResearchSpec 评深度研究公开三套基准分别高出对照里最强的 0.30、3.17、5.62。内部基准 76.04,仍比 ChatGPT 的完整 Deep Research 低 0.55。计划固定后不再重开,编辑加轮次也不保证每项都涨。