
HELM全称Holistic Evaluation of Language Models(语言模型整体评估)是由斯坦福大学推出的大模型评测体系,该评测方法主要包括场景、适配、指标三个模块,每次评测的运行都需要指定一个场景,一个适配模型的提示,以及一个或多个指标。它评测主要覆盖的是英语,有7个指标,包括准确率、不确定性/校准、鲁棒性、公平性、偏差、毒性、推断效率;任务包括问答、信息检索、摘要、文本分类等。
相关导航


无界AI
无界AI是无界版图推出的专注于AIGC(人工智能创作图片、漫画与视频)的社区和平台,研发符合中国审美的绘画大模型(国风、国潮、国漫),结合区块链技术,对AI作品进行版权登记与保护,集聚国内AI魔法师与炼丹师们,打造AIGC的内容社区与商业化应用。

Warp
21世纪的终端工具(内置AI命令搜索)

Google翻译
Google免费提供的上百种语言智能翻译工具

Augment
Augment是一个由经验丰富的AI和开发者体验专家组成的团队创建的AI编程辅助工具,专为大型代码库设计,能够根据公司代码中的API和编码模式提供建议,帮助开发者在日常工作中提高效率。

Duo Chat
Duo Chat 是源代码管理平台 GitLab 推出的一款集成了人工智能(AI)的对话式编程助手,旨在通过自然语言交互为工程和非工程用户提供实时指导。该AI编程工具支持整个软件开发生命周期,帮助团队提高代码理解速度、增强协作能力,并快速掌握 GitLab 的使用。

GitHub Copilot
微软与OpenAI共同开发的一款AI编程工具GitHub Copilot

AI工具大全
一个收录AI的应用工具
