小红书这场大模型论文分享会，集齐了四大国际顶会的作者

WBOY

发布时间：2024-08-05 19:12:02

524人浏览过

来源于机器之心

转载

大模型正引领新一轮的研究热潮，业界和学术界都涌现出了众多的创新成果。

小红书技术团队也在这一浪潮中不断探索，多篇论文研究成果在 ICLR、ACL、CVPR、AAAI、SIGIR、WWW 等国际顶会上频频亮相。

在大模型与自然语言处理的交汇处，我们发现了哪些新机遇和挑战？

对于大模型，有哪些有效的评测方法？它又如何更好地融入到应用场景中的呢？

6 月 27 日 19:00-21:30，【REDtech 来了】第十一期《小红书 2024 大模型前沿论文分享》线上开播！

REDtech 特别邀请了小红书社区搜索团队来到直播间，他们将分享 6 篇小红书在 2024 年发表的大模型研究论文。小红书精排 LTR 负责人冯少雄，携手多位顶会论文作者李易为、王星霖、袁沛文、张超等人，共同探讨最新的大模型解码与蒸馏技术、大模型评测方法，以及大模型在小红书平台上的实际应用。

预约直播，多篇论文一作作者在线与你交流！你将获得关于大模型技术的最新见解，探讨未来的发展趋势，并交流如何利用这些前沿技术提升用户体验，推动平台智能化发展。

活动议程 小红书这场大模型论文分享会，集齐了四大国际顶会的作者

01 Escape Sky-high Cost: Early-stopping Self-Consistency for Multi-step Reasoning / 入选 ICLR 2024

针对大模型多步推理中高成本问题的早停自洽性方法｜分享人：李易为

自洽性方法（Self-Consistency，SC）一直是思维链推理中广泛使用的解码策略，通过生成多个思维链并取多数答案作为最终答案，来提高模型的性能。但它是一种高成本的方法，需要进行预设大小的多次采样。在 ICLR 2024 上，小红书提出一种简单且可扩展的采样过程 —— 早停自洽性方法（Early-Stopping Self-Consistency，ESC），它能在不牺牲性能的情况下，大幅度降低 SC 的成本。在此基础上，团队进一步推导出一种 ESC 控制方案，以动态选择不同任务和模型的性能 - 成本平衡。三种主流推理任务（数学，常识和符号推理）的实验结果显示，ESC 在六个基准测试中显著降低了平均采样次数，同时几乎保持原有性能。

论文地址：https://arxiv.org/abs/2401.10480

02 Integrate the Essence and Eliminate the Dross: Fine-Grained Self-Consistency for Free-Form Language Generation / 入选 ACL 2024

去粗取精：面向自由格式生成任务的细粒度自洽性方法｜ 分享人：王星霖

小红书在 ACL 2024 中提出了 Fine-Grained Self-Consistency (FSC) 方法，能够显著提升自洽性方法在自由格式生成任务上的表现。团队首先通过实验分析了现有面向自由格式生成任务的自洽性方法的不足来自于粗粒度的共性样本选择，其无法有效利用不同样本细粒度片段之间的共性知识。在此基础上团队提出了基于大模型自融合的 FSC 方法，实验证实其在代码生成、摘要生成以及数学推理任务上都取得了显著更优的表现，同时保持了相当的消耗。

论文地址：https://github.com/WangXinglin/FSC

03 BatchEval: Towards Human-like Text Evaluation / 入选 ACL 2024，领域主席给出满分评分，并推荐最佳论文

迈向人类水平的文本评测｜ 分享人：袁沛文

小红书在 ACL 2024 中提出了 BatchEval 方法，能够以更低的开销达到类人水平的文本评测效果。团队首先从理论层面分析了现有文本评测方法在评测鲁棒性方面的不足来自于评测打分分布不均匀、在得分集成方面的次优表现源自于评测视角多样性的缺失。在此基础上，受人类评测过程中通过样本间比较来建立更加立体全面、视角多样的评测基准启发，类比提出了 BatchEval。与当前最先进的若干方法相比，BatchEval 在评测开销与评测效果两方面都取得了显著更优的表现。

论文地址：https://arxiv.org/abs/2401.00437

04 Poor-Supervised Evaluation for SuperLLM via Mutual Consistency / 入选 ACL 2024

通过互一致性实现准确监督信号匮乏下的超人水平大语言模型评测｜ 分享人：袁沛文

小红书在 ACL 2024 中提出了 PEEM 方法，其能够通过模型间的互一致性实现对于超越人类水平的大语言模型的准确评测。团队首先分析了当前大语言模型迅猛发展的趋势会加速其在多个方面逐渐达到甚至超越人类水平，在此情况下，人类将难以再提供准确的评测信号。为实现该场景下的能力评测，团队提出了以模型间的互一致性为评测信号的设想，并推导出了在评测样本无穷时，如果存在参考模型与待评测模型间预测分布独立，则与该参考模型间的一致性可以作为模型能力的准确度量。在此基础上，团队提出了基于 EM 算法的 PEEM 方法，实验证实其能够有效缓解现实中上述条件的不充足，从而实现对超越人类水平的大语言模型的准确评测。

论文地址：https://github.com/ypw0102/PEEM

腾讯交互翻译

腾讯AI Lab发布的一款AI辅助翻译产品

下载

05 Turning Dust into Gold：Distilling Complex Reasoning Capabilities from LLMs by Leveraging Negative Data / 入选 AAAI 2024 Oral

利用负样本促进大模型推理能力的蒸馏｜ 分享人：李易为

大语言模型（LLMs）在各种推理任务上表现优异，但其黑盒属性和庞大参数量阻碍了它在实践中的广泛应用。特别是在处理复杂的数学问题时，LLMs 有时会产生错误的推理链。传统研究方法仅从正样本中迁移知识，而忽略了那些带有错误答案的合成数据。在 AAAI 2024 上，小红书搜索算法团队提出了一个创新框架，首次提出并验证了负样本在模型蒸馏过程中的价值，构建一个模型专业化框架，除了使用正样本外，还充分利用负样本来提炼 LLM 的知识。该框架包括三个序列化步骤，包括负向协助训练（NAT）、负向校准增强（NCE）和动态自洽性（ASC），涵盖从训练到推理的全阶段过程。一系列广泛的实验，展示了负向数据在 LLM 知识蒸馏中的关键作用。

论文地址：https://arxiv.org/abs/2312.12832

06 NoteLLM: A Retrievable Large Language Model for Note Recommendation / 入选 WWW 2024

基于大语言模型的笔记内容表征推荐系统｜ 分享人：张超

小红书 APP 每天都有大量新笔记产生，如何有效地将这些新内容推荐给感兴趣的用户呢？基于笔记内容的推荐表征是缓解笔记冷启动问题的一种方法，也是众多下游应用的基础。近年来，大语言模型因其强大的泛化性和文本理解能力而备受关注。因此，我们希望利用大语言模型构建笔记内容表征推荐系统，以增强笔记内容的理解。我们从生成增强表征以及多模态内容表征两个角度介绍我们近期的工作。目前该系统已应用于小红书多个业务场景并取得显著收益。

论文地址：https://arxiv.org/abs/2403.01744

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

小红书这场大模型论文分享会，集齐了四大国际顶会的作者

直播观看方式

直播时间：2024 年 6 月 27 日 19：00-21：30
直播平台：微信视频号【小红书技术 REDtech】，B 站、抖音、小红书同名账号实时直播。

同时，直播也将在合作伙伴【极市平台】、【本站】、【Datawhale】微信视频号同步播出。

欢迎你填写问卷告诉我们，关于大模型你关心的问题，在直播期间与嘉宾深入互动。

小红书这场大模型论文分享会，集齐了四大国际顶会的作者

扫描?下方二维码进入直播交流群，将第一时间获取直播链接及开播提醒；可一键打包获取精心整理的【论文 PDF 合集】，还有机会与论文作者直接交流！

小红书这场大模型论文分享会，集齐了四大国际顶会的作者

邀请好友预约直播好礼

小红书这场大模型论文分享会，集齐了四大国际顶会的作者

小红书社区搜索团队多岗位热招中，团队负责小红书搜索效果的优化和前沿技术的探索，致力于打造中国最大的生活搜索引擎。期待你的加入！

小红书这场大模型论文分享会，集齐了四大国际顶会的作者

贾跃亭：法拉第未来当前股价被严重低估目标价5美元

内存飙升成本暴涨汽车会涨价还是减配？

10家中国车企入围入围财富世界500强比亚迪进前百

关税压力下创纪录！韩国汽车年出口额达720亿美元

韩国2025年电动车销量首破20万辆中国产汽车大卖

小红书

小红书是一款集种草分享、生活购物、社交于一体的综合app。小红书汇集了时尚、美容、生活方式、旅行、美食等多个领域的内容，为用户提供了丰富多彩的体验和无限灵感，有需要的小伙伴快来保存下载体验吧！

下载

相关专题

github中文官网入口 github中文版官网网页进入

github中文官网入口https://docs.github.com/zh/get-started，GitHub 是一种基于云的平台，可在其中存储、共享并与他人一起编写代码。通过将代码存储在GitHub 上的“存储库”中，你可以： “展示或共享”你的工作。持续“跟踪和管理”对代码的更改。

4163

2026.01.21

页面置换算法

页面置换算法是操作系统中用来决定在内存中哪些页面应该被换出以便为新的页面提供空间的算法。本专题为大家提供页面置换算法的相关文章，大家可以免费体验。

497

2023.08.14

http与https有哪些区别

http与https的区别：1、协议安全性；2、连接方式；3、证书管理；4、连接状态；5、端口号；6、资源消耗；7、兼容性。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

2907

2024.08.16

什么是搜索引擎

搜索引擎是一种互联网工具，用于帮助用户在网上查找信息。搜索引擎的目标是提供最准确、最有价值的搜索结果，使用户能够快速找到所需的信息。本专题为大家提供搜索引擎相关的各种文章、以及下载和课程。

489

2023.08.02

有哪些目录搜索引擎

目录搜索引擎有Google、Bing、Yahoo、Baidu、DuckDuckGo等。想了解更多目录搜索引擎的相关内容，可以阅读本专题下面的文章。

6446

2023.11.06

搜索引擎营销的主要模式

搜索引擎营销的主要模式包括：1. 竞价排名（ppc）；2. 搜索引擎优化（seo）；3. 本地搜索营销；4. 购物广告；5. 视频广告；6. 展示广告；7. 社交媒体营销；8. 移动广告。想了解更多搜索引擎营销的相关内容，可以阅读本专题下面的文章。

473

2024.05.20

C# ASP.NET Core微服务架构与API网关实践

本专题围绕 C# 在现代后端架构中的微服务实践展开，系统讲解基于 ASP.NET Core 构建可扩展服务体系的核心方法。内容涵盖服务拆分策略、RESTful API 设计、服务间通信、API 网关统一入口管理以及服务治理机制。通过真实项目案例，帮助开发者掌握构建高可用微服务系统的关键技术，提高系统的可扩展性与维护效率。

2026.03.11

Go高并发任务调度与Goroutine池化实践

本专题围绕 Go 语言在高并发任务处理场景中的实践展开，系统讲解 Goroutine 调度模型、Channel 通信机制以及并发控制策略。内容包括任务队列设计、Goroutine 池化管理、资源限制控制以及并发任务的性能优化方法。通过实际案例演示，帮助开发者构建稳定高效的 Go 并发任务处理系统，提高系统在高负载环境下的处理能力与稳定性。

2026.03.10

Kotlin Android模块化架构与组件化开发实践

本专题围绕 Kotlin 在 Android 应用开发中的架构实践展开，重点讲解模块化设计与组件化开发的实现思路。内容包括项目模块拆分策略、公共组件封装、依赖管理优化、路由通信机制以及大型项目的工程化管理方法。通过真实项目案例分析，帮助开发者构建结构清晰、易扩展且维护成本低的 Android 应用架构体系，提升团队协作效率与项目迭代速度。

2026.03.09

热门下载

网站特效

网站源码

网站素材

前端模板