按要解决的问题全部方案→
CodexQA 平台 · 7 个模块
服务
私有化与采购
学习
公司
按要解决的问题全部方案 →
公开课/大模型与 Agent 评测实战
共 19 讲
第 19 讲 · 29:37
本讲实验:简介写的是 Nature 论文:用语义熵检测大语言模型幻觉。
在 B 站打开这一集THUAIR_人机交互研究组B 站合集视频由 B 站播放。
一门课讲清 AI 测评和传统测试差在哪,指标、流程、风险和缺陷怎么定级,再用 EvalScope 对接 Langfuse 把一批用例跑起来。视频来自学掌门的公开合集,站点只收测评主线。
想让团队一起学?团队培训按范围安排。 预约评估
看完, 自己跑一遍
技能免费,在本地运行,报告落在你的磁盘上。