Total Pageviews

Showing posts with label nlp. Show all posts
Showing posts with label nlp. Show all posts

Monday, 13 June 2022

编程书籍搜集

编程书籍搜集(Programming Books Collections)
GitHub watchers GitHub forks GitHub Repo stars GitHub

我的其他项目

JavaPark code-library

说明

如果遇到链接失效或有其他问题,建议提交 Issue 或者邮件:747731461@qq.com

也欢迎大家积极参与到项目中,一起推荐更多的资源,帮助更多的小伙伴!

笔者是一个人维护该仓库,资源需要一步步上传,我只能在上班之余慢慢更新,所以更新比较慢,还请谅解。如果在这里没用找到你想要的书,可以添加我的个人微信(cunyu1024),注明来意,我会慢慢更新上去的!

本仓库持续更新中,后续会陆续添加更多资源,强烈建议大家 Star 本仓库,找书的话可以直接 Ctrl + F 搜索,大幅提高效率。

此外,分享方式分为百度云盘和蓝奏云分享,但限于蓝奏云上传文件大小限制,所以有的文件只有百度云盘分享的方式。

导航

C 语言

  1. 《C程序设计语言(第2版·新版)》:百度云链接 提取码: kx6k;蓝奏云
  2. 《啊哈磊 - 啊哈c语言》:❌百度云链接 提取码:h5zs;✅蓝奏云
  3. 《安德鲁 - C陷阱与缺陷(C和C++经典著作)》:❌百度云链接 提取码:g0vx;✅蓝奏云
  4. 《布拉德利 - 21天学通C语言(第六版)》:百度云链接 提取码:8fzp;✅蓝奏云
  5. 《柴田望洋 - 明解C语言》:❌百度云链接 提取码:c51h;✅蓝奏云
  6. 《大卫.格里芬 - Head.First.C(2012)》:❌百度云链接 提取码:3h1f;✅蓝奏云
  7. 《霍尔顿 - c语言入门经典(第5版)》:百度云链接 提取码:87aa
  8. 《斯蒂芬 - C Primer Plus(第五版)中文版》:❌百度云链接 提取码:j0jb;✅蓝奏云
  9. 《斯蒂芬.沙梅特- 你必须知道的495个C语言问题》:❌百度云链接 提取码:786c;✅蓝奏云
  10. 《斯科特 - Effective C 中文版(第3版)》:百度云链接 提取码:9hq8
  11. 《王娣 - C语言从入门到精通》:❌百度云链接 提取码:kish;✅蓝奏云
  12. 《张小潘 - C语言编程:一本全面的C语言入门教程 (第3版)》:❌百度云链接 提取码:bi8n;✅蓝奏云
  13. 《郑赟 - Hello C语言》:❌百度云链接 提取码:umaa;✅蓝奏云

C++

  1. 《C++并发编程实战_[美]Anthony+Williams_人民邮电》:百度云链接 提取码: qgv7 ;蓝奏云
  2. 《Effective C++中文版(第三版)》:百度云链接 提取码: z4ep ;蓝奏云
  3. 《Google C++ 编程风格指南》:❌百度云链接 提取码:lqxs;✅蓝奏云
  4. 《保罗·戴特尔 - C++大学教程(第九版)》:百度云链接 提取码:vr4p
  5. 《斯蒂芬 - C++ Primer Plus中文版第五版》:❌百度云链接 提取码:qlan;✅蓝奏云
  6. 《斯蒂芬 - C++.Primer.Plus 中文第 6 版》:❌百度云链接 提取码:6y19;✅蓝奏云
  7. 《斯科特 - C++高级编程(第2版)》:百度云链接 提取码:k6lu

Go

  1. 《Go 语言 101》:百度云链接 提取码:pbko
  2. 《Go语言圣经-中文版》:百度云链接 提取码: hkne;蓝奏云
  3. 《William Kennedy - Go 语言实战》:百度云链接 提取码:z0ap
  4. 《柴树杉 - Go语言高级编程》:百度云链接 提取码:vosy
  5. 《李文塔 - Go语言核心编程》:百度云链接 提取码:ava7
  6. 《雨痕 - Go 语言学习笔记》:百度云链接 提取码:n0xp

Java

  1. 《Head First Java(第2版)中文版》:百度云链接 提取码:vtqj
  2. 《Java 8 简明教程》:百度云链接 提取码:8eq0
  3. 《Java编程思想(第4版)》:百度云链接 提取码:g82t
  4. 《Java常见面试题指南》:百度云链接 提取码:p2do
  5. 《Java经典编程300例 》:❌百度云链接 提取码:rp10;✅蓝奏云
  6. 《Java面试手册(百家企业总汇)》:百度云链接 提取码:15lv
  7. 《Spring Boot2 教程》:百度云链接 提取码:2hh4
  8. 《Spring5中文参考指南》:百度云链接 提取码:ykc3
  9. 《SpringBoot 从入门到进阶系列官方小册》:百度云链接 提取码:4ayr
  10. 《SpringMVC面试专题及答案》:百度云链接 提取码:qlh8
  11. 《阿里巴巴Java开发手册「泰山版」》:百度云链接 提取码:4jip
  12. 《丁雪丰 (译) - Spring Boot实战 》:百度云链接 提取码:1ty5
  13. 《多线程、JVM复习及面试100题》:百度云链接 提取码:hknv
  14. 《方志朋 - 深入理解Spring Cloud与微服务构建》:百度云链接 提取码:8wwy
  15. 《葛一鸣 - 实战Java高并发程序设计(第2版)》:百度云链接 提取码:4v6j
  16. 《龚鹏 - 微服务分布式构架开发实战》:百度云链接 提取码:4u04
  17. 《韩楷 - JAVA并发编程实战》:百度云链接 提取码:hsrm
  18. 《杭建 - Java工程师修炼之道》:百度云链接 提取码:mma6
  19. 《霍陆续 - Java并发编程之美》:百度云链接 提取码:qfuw
  20. 《霍斯特曼 - Java核心技术 卷1 基础知识 第10版》:百度云链接 提取码:qdkw
  21. 《霍斯特曼 - Java核心技术 卷2 高级特性 第10版》:百度云链接 提取码:qlno
  22. 《克雷格 - Spring实战(第4版)》:百度云链接 提取码:luz0
  23. 《刘增辉 - MyBatis从入门到精通》:百度云链接 提取码:qzaz
  24. 《罗刚 - 网络爬虫全解析 技术、原理与实践》:百度云链接 提取码:zvc1
  25. 《深入浅出Java多线程》:百度云链接 提取码:0sk9
  26. 《许进 - 重新定义Spring Cloud实战》:百度云链接 提取码:cp3v
  27. 《俞黎敏 - Effective Java中文版(原书第3版)》:百度云链接 提取码:chhd
  28. 《周志明 - 深入理解Java虚拟机(第2版)》:百度云链接 提取码:3flo
  29. 《周志明 - 深入理解Java虚拟机(第3版)》:百度云链接 提取码:hahr

Linux

  1. 《菲利普 - Linux性能优化》:百度云链接 提取码:q3fo
  2. 《理查德 - Linux命令行与shell脚本编程大全.第3版》:百度云链接 提取码:urig
  3. 《刘遄 - Linux就该这么学》:百度云链接 提取码:n4or
  4. 《孟宁 - 疱丁解牛Linux内核分析》:百度云链接 提取码:og7v
  5. 《尼尔.马修斯 - Linux程序设计(第4版)》:百度云链接 提取码:apks
  6. 《鸟哥- 鸟哥的私房菜:基础学习篇(第 4 版)》:百度云链接 提取码:9pbs

Python

  1. 《Mahesh - Python极客项目编程_(美)》:百度云链接 提取码:auhf
  2. 《Python标准库中文版》:百度云链接 提取码:skmw
  3. 《埃里克.马修斯 - Python编程:从入门到实践及源码》:百度云链接 提取码:9lf7
  4. 《安道(译) - FlaskWeb开发:基于Python的Web应用开发实战》:百度云链接 提取码:p6og
  5. 《笨办法学 Python》:百度云链接 提取码:24z2
  6. 《布雷特 - Effective Python》:百度云链接 提取码:hddh
  7. 《大卫.贝兹利 - Python参考手册(第4版)》:百度云链接 提取码:feay
  8. 《董付国 - Python可以这样学》:百度云链接 提取码:7aqq
  9. 《胡世杰 - Python高性能编程》:百度云链接 提取码:43ps
  10. 《李金洪 - Python带我起飞:入门、进阶、商业实战》:百度云链接 提取码:q5e9
  11. 《理查德.劳森 - 用Python写网络爬虫》:百度云链接 提取码:pee5
  12. 《马克.鲁兹 - Python学习手册 第4版》:百度云链接 提取码:d98f
  13. 《齐伟 - 跟老齐学Python:数据分析》:百度云链接 提取码:j5xs
  14. 《齐伟 - 跟老齐学Python从入门到精通》:百度云链接 提取码:hjyb
  15. 《斯维加特 - Python游戏编程快速上手》:百度云链接 提取码:ja6a
  16. 《王海鹏(译) - Python编程快速上手-让繁琐工作自动化》:百度云链接 提取码:ku6u
  17. 《韦斯利 - Python核心编程 第二版》:百度云链接 提取码:k4on
  18. 《熊能 - Python Cookbook第三版中文》:百度云链接 提取码:z2le
  19. 《詹姆斯.佩恩 - Python编程入门经典》:百度云链接 提取码:pdc7
  20. 《张颖 - 编写高质量代码:改善Python程序的91个建议迷你书》:百度云链接 提取码:ei7v

办公

  1. 《大道至简 Excel这么学最简单》:百度云链接 提取码:eeoy
  2. 《郭新房 - Visio 2013图形设计从新手到高手》:❌百度云链接 提取码:hwuj;✅蓝奏云
  3. 《李栋 - PPT高手之路》:百度云链接 提取码:vcx6
  4. 《李金蓉 - Photoshop CC高手成长之路》:百度云链接 提取码:wwoq
  5. 《零一 - Excel BI之道:从零开始学Power工具应用》:❌百度云链接 提取码:yg0m;✅蓝奏云
  6. 《毛宇航 - Flash CC动画制作实战从入门到精通》:❌百度云链接 提取码:04nh;✅蓝奏云
  7. 《秋叶 - 和秋叶一起学 PPT又快又好打造说服力幻灯片》:❌百度云链接 提取码:arqj;✅蓝奏云
  8. 《秋叶 - 和秋叶一起学Excel_秋叶_人民邮电_2017.7》:❌百度云链接 提取码:amfb;✅蓝奏云
  9. 《秋叶 - 和秋叶一起学WORD(第2版)》:❌百度云链接 提取码:yfcm;✅蓝奏云
  10. 《史卫亚 - Excel 2019从入门到精通》:百度云链接 提取码:ms7k
  11. 《先锋影像 - Photoshop摄影后期必备99招》:❌百度云链接 提取码:gwpd;✅蓝奏云
  12. 《叶霞 - 财务信息处理与分析:Excel 2016》:❌百度云链接 提取码:vnhs;✅蓝奏云
  13. 《易学易用系列 新编EXCEL 2016从入门到精通》:百度云链接 提取码:2mlf

程序员必读

  1. 《保罗.格拉汉姆 - 黑客与画家(中文版)》:百度云链接 提取码:wwlv
  2. 《编程之美——微软技术面试心得》:百度云链接 提取码:2h3s
  3. 《大卫·古尔力 - HTTP权威指南》:百度云链接 提取码:wo1k
  4. 《亨特.托马斯 - 程序员修炼之道:从小工到专家》:百度云链接 提取码:diss
  5. 《黄倩(译) - 编程珠玑 第2版(修订版)》:百度云链接 提取码:nwz8
  6. 《兰德尔 - 程序设计与计算机系统_深入理解计算机系统(中文版第二版)》:百度云链接 提取码:hrnk
  7. 《马丁- 代码整洁之道》:链接:百度云链接 提取码:16c8
  8. 《马丁.福勒 - 重构-改善既有代码的设计》:百度云链接 提取码:ren7
  9. 《佩措尔德 - 编码:隐匿在计算机软硬件背后的语言》:百度云链接 提取码:31cq
  10. 《上野宣 - 图解HTTP》:百度云链接 提取码:fqcj
  11. 《斯蒂文.麦克康纳 - 代码大全2》:百度云链接 提取码:f40r
  12. 《王元杰 - 一本书读懂TCPIP》:百度云链接 提取码:j7h7
  13. 《西尾泰和 - 代码之髓 编程语言核心概念》:百度云链接 提取码:yt23
  14. 《俞甲子 - 程序员的自我修养--链接、装载与库》:百度云链接 提取码:kyba

大数据与云计算

  1. 《耿嘉安 - 深入理解Spark+核心思想与源码分析》:百度云链接 提取码:1tdn
  2. 《胡夕 - Apache_kafka实战》:百度云链接 提取码:7r32
  3. 《拉斐尔 - 深入理解ElasticSearch》:百度云链接 提取码:6oev
  4. 《魏祖宽 - 基于Hadoop的大数据分析和处理》:百度云链接 提取码:9mfh
  5. 《肖冠宇 - 企业大数据处理:Spark、Druid、Flume与Kafka应用实践》:百度云链接 提取码:5ytc
  6. 《杨宝华 - DOCKER技术入门与实战》:百度云链接 提取码:586v
  7. 《杨传辉 - 大规模分布式存储系统:原理解析与架构实战》:百度云链接 提取码:39cl
  8. 《朱凯 - 企业级大数据平台构建:架构与实现》:百度云链接 提取码:o3e6

前端

  1. 《CSS权威指南(第3版)》:百度云链接 提取码:a2fm
  2. 《Head First HTML与CSS、XHTML(中文版)》:百度云链接 提取码:4g0z
  3. 《HTML5基础知识、核心技术与前沿案例》:百度云链接 提取码:xw2f
  4. 《HTML5移动应用开发入门经典》:百度云链接 提取码:2ax6
  5. 《JavaScript权威指南(第6版)(中文版)》:百度云链接 提取码:rt0c
  6. 《锋利的jQuery》:百度云链接 提取码:bwob
  7. 《高效前端:Web高效编程与优化实践》:百度云链接 提取码:8axx
  8. 《莱西格 - JavaScript忍者秘籍 第2版》:百度云链接 提取码:yi58
  9. 《前端面试指南》:百度云链接 提取码:am7v
  10. 《张俊达 - react快速上手开发》:百度云链接 提取码:uohj

人工智能

机器学习

  1. 《机器学习最优化课程笔记》:百度云链接 提取码:fs83
  2. 《赵春江- 机器学习经典算法剖析:基于OpenCV》:百度云链接 提取码:6zu0
  3. 《周志华- 机器学习》:百度云链接 提取码:hqra

深度学习

  1. 《Aston Zhang - 动手学深度学习》:百度云链接 提取码:wvhd
  2. 《陈仲铭 - 深度学习原理与实践》:百度云链接 提取码:bw3b
  3. 《邱锡鹏- 神经网络与深度学习》:百度云链接 提取码:z057
  4. 《塔里克.拉希德 - Python神经网络编程》:百度云链接 提取码:p9s0
  5. 《王晓华 - TensorFlow深度学习应用实践》:百度云链接 提取码:uc0w
  6. 《闫涛 - 深度学习算法实践(基于Theano和TensorFlow)》:百度云链接 提取码:72eo
  7. 《伊恩.古德菲洛 - 深度学习》:百度云链接 提取码:t038
  8. 《斋藤康益 - 深度学习入门:基于Python的理论与实现》:百度云链接 提取码:d6z8
  9. 《张玉宏 - 深度学习之美:AI时代的数据处理与最佳实践》:百度云链接 提取码:k6ko

计算机视觉

自然语言处理

  1. 《Susan Li - Develop a NLP Model in Python & Deploy It with Flask, Step by Step》:百度云链接 提取码:rbcb
  2. 《丹尼尔 - 自然语言处理综述(英文第三版)》:百度云链接 提取码:ik9u
  3. 《克里斯托弗·d·曼宁 - 统计自然语言处理基础》:百度云链接 提取码:2v72
  4. 《肖桐 - 机器翻译统计建模与深度学习方法》:❌百度云链接 提取码:bdz3;✅蓝奏云
  5. 《克里斯托弗·d·曼宁 - 信息检索导论》:百度云链接 提取码:wx9h
  6. 《用Python进行自然语言处理》:百度云链接 提取码:bk9t
  7. 《宗成庆- 统计自然语言处理 》:百度云链接 提取码:di75

其他

  1. 《AI算法工程师手册》:百度云链接 提取码:8pgj

数据结构与算法

  1. 《C语言经典算法大全》:百度云链接 提取码:79rq

  2. 《啊哈磊 - 啊哈!算法》:百度云链接 提取码:t9gu

  3. 《布莱恩.克里斯汀 - 算法之美》:百度云链接 提取码:d0i5

  4. 《程杰 - 最新大话数据结构》:百度云链接 提取码:0u9i

  5. 《邓俊辉 - 数据结构(C++语言版)第三版》:百度云链接 提取码:9mzv

  6. 《莱维汀 - 算法设计与分析基础》:百度云链接 提取码:1qie

  7. 《刘汝佳 - 算法竞赛入门经典(第2版) (算法艺术与信息学竞赛)》:百度云链接 提取码:2dzp

  8. 《马克.艾伦 - 数据结构与算法分析:C语言描述_原书第2版》:百度云链接 提取码:j7ac

  9. 《马克.艾伦 - 数据结构与算法分析 java语言描述(原书第3版)》:百度云链接 提取码:wudn

  10. 《托马斯 - 算法导论(原书第3版) 中文完整版》:百度云链接 提取码:8jzq

  11. 《王晓华 - 算法的乐趣》:百度云链接 提取码:f1zy

  12. 《魏梦舒 - 漫画算法:小灰的算法之旅》:百度云链接 提取码:5frw

  13. 《谢路云 - 算法(第4版)-文字版》:百度云链接 提取码:w334

  14. 《袁国忠 - 算法图解》:百度云链接 提取码:va1d

  15. 《左程云 - 程序员代码面试指南 IT名企算法与数据结构题目最优解》:百度云链接 提取码:3pyv

数据库

  1. 《Baron - 高性能 MySQL 第三版》:百度云链接 提取码:zz63
  2. 《MySQL5.7从入门到精通》:百度云链接 提取码:qnfy
  3. 《MySQL是怎样运行的:从根儿上理解MySQL》:❌百度云链接 提取码:2znu;✅蓝奏云
  4. 《MySQL性能调优与架构设计+PDF中文版全册》:百度云链接 提取码:t9wu
  5. 《Tapio - 数据库索引设计与优化》:百度云链接 提取码:c1dk
  6. 《姜承尧 - MySQL技术内幕:SQL编程》:百度云链接 提取码:iq0f
  7. 《孔祥盛 - MySQL核心技术与最佳实践》:百度云链接 提取码:sb1s
  8. 《刘晓霞(译)- MySQL必知必会》:百度云链接 提取码:el0a
  9. 《王强 - sql cookbook》:百度云链接 提取码:na7w
  10. 《张权 - SQL查询的艺术》:百度云链接 提取码:8he9

个人提升

  1. 《被讨厌的勇气》:百度云链接 提取码:8oyb
  2. 《产品经理必懂的技术那点事儿》:百度云链接 提取码:svnp
  3. 《大脑修复术》:百度云链接 提取码:dr0s
  4. 《动机心理学》:百度云链接 提取码:9ciq
  5. 《读懂一本书:樊登读书法樊登》:百度云链接 提取码:uiwk
  6. 《富爸爸穷爸爸》:百度云链接 提取码:otvi
  7. 《改变未来的九大算法》:百度云链接 提取码:h8gr
  8. 《硅谷简史:通往人工智能之路》:百度云链接 提取码:ynh4
  9. 《硅谷精英的创业秘籍》:百度云链接 提取码:pcob
  10. 《机器人简史》:百度云链接 提取码:471r

from  https://github.com/cunyu1943/ebooks

Sunday, 24 April 2022

DataAug4NLP

 Collection of papers and resources for data augmentation for NLP.

arxiv.org/abs/2105.03075

Data Augmentation Techniques for NLP.

If you'd like to add your paper, do not email us. Instead, read the protocol for adding a new entry and send a pull request.

We group the papers by text classification, translation, summarization, question-answering, sequence tagging, parsing, grammatical-error-correction, generation, dialogue, multimodal, mitigating bias, mitigating class imbalance, adversarial examples, compositionality, and automated augmentation.

This repository is based on our paper, "A survey of data augmentation approaches in NLP (Findings of ACL '21)". You can cite it as follows:

@inproceedings{feng-etal-2021-survey,
    title = "A Survey of Data Augmentation Approaches for {NLP}",
    author = "Feng, Steven Y.  and
      Gangal, Varun  and
      Wei, Jason  and
      Chandar, Sarath  and
      Vosoughi, Soroush  and
      Mitamura, Teruko  and
      Hovy, Eduard",
    booktitle = "Findings of the Association for Computational Linguistics: ACL-IJCNLP 2021",
    month = aug,
    year = "2021",
    address = "Online",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2021.findings-acl.84",
    doi = "10.18653/v1/2021.findings-acl.84",
    pages = "968--988",
}

Authors: Steven Y. Feng, Varun Gangal, Jason Wei, Sarath Chandar, Soroush Vosoughi, Teruko Mitamura, Eduard Hovy

Special thanks to Ryan Shentu, Fiona Feng, Karen Liu, Emily Nie, Tanya Lu, and Bonnie Ma for helping out with this repo. Note: WIP. More papers will be added from our survey paper to this repo soon. Inquiries should be directed to stevenyfeng@gmail.com or by opening an issue here.

Also, check out our talk for Google Research (Steven Feng and Varun Gangal) here, and our podcast episode (Steven Feng and Eduard Hovy) here and here.

Text Classification

PaperDatasets
Unsupervised Word Sense Disambiguation Rivaling Supervised Methods (ACL '95)Paper-Specific/Legacy Corpus
Synonym Replacement (Character-Level Convolutional Networks for Text Classification, NeurIPS '15)AG’s News, DBPedia, Yelp, Yahoo Answers, Amazon
That’s So Annoying!!!: A Lexical and Frame-Semantic Embedding Based Data Augmentation Approach to Automatic Categorization of Annoying Behaviors using #petpeeve Tweets (EMNLP '15)twitter
Robust Training under Linguistic Adversity (EACL '17) codeMovie review, customer review, SUBJ, SST
Contextual Augmentation: Data Augmentation by Words with Paradigmatic Relations (NAACL '18) codeSST, SUBJ, MRQA, RT, TREC
Variational Pretraining for Semi-supervised Text Classification (ACL '19) codeIMDB, AG News, Yahoo, hatespeech
EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks (EMNLP '19) codeSST, CR, SUBJ, TREC, PC
A Closer Look At Feature Space Data Augmentation For Few-Shot Intent Classification (DeepLo @ EMNLP '19)SNIPS
Nonlinear Mixup: Out-Of-Manifold Data Augmentation for Text Classification (AAAI '20)TREC, SST, Subj, MR
MixText: Linguistically-Informed Interpolation of Hidden Space for Semi-Supervised Text Classification (ACL '20) codeAG News, DBpedia, Yahoo, IMDb
Unsupervised Data Augmentation for Consistency Training (NeurIPS '20) codeYelp, IMDb, amazon, DBpedia
Not Enough Data? Deep Learning to the Rescue! (AAAI '20)ATIS, TREC, WVA
Data Augmentation using Pre-trained Transformer Models LifeLongNLP @ AACL '20, codeSNIPS, TREC, SST2
SSMBA: Self-Supervised Manifold Based Data Augmentation for Improving Out-of-Domain Robustness (EMNLP '20) codeIWSLT'14
Data Boost: Text Data Augmentation Through Reinforcement Learning Guided Conditional Generation (EMNLP '20)ICWSM 20’ Data Challenge, SemEval '17 sentiment analysis, SemEval '18 irony
Textual Data Augmentation for Efficient Active Learning on Tiny Datasets (EMNLP '20)SST2, TREC
Text Augmentation in a Multi-Task View (EACL '21)SST2, TREC, SUBJ
GPT3Mix: Leveraging Large-scale Language Models for Text Augmentation (arXiv '21)SST2, CR, TREC, SUBJ, MPQA, CoLA
Few-Shot Text Classification with Triplet Loss, Data Augmentation, and Curriculum Learning (NAACL '21) codeHUFF, COV-Q, AMZN, FEWREL
Text AutoAugment: Learning Compositional Augmentation Policy for Text Classification (EMNLP '21) codeIMDB, SST2, SST5, TREC, YELP2, YELP5

Translation

PaperDatasets
Backtranslation (Improving Neural Machine Translation Models with Monolingual Data, ACL '16)WMT '15 en-de, IWSLT '15 en-tr
Adapting Neural Machine Translation with Parallel Synthetic Data (WMT '17)COMMON, 1 Billion Words, dev2013, XRCE, IT, E-Com
Data Augmentation for Low-Resource Neural Machine Translation (ACL '17) codeWMT '14/'15/'16 en-de/de-en
Synthetic Data for Neural Machine Translation of Spoken-Dialects (arxiv '17)LDC2012T09, OpenSubtitles-2013
Multi-Source Neural Machine Translation with Data Augmentation (IWSLT '18)TED Talks
SwitchOut: an Efficient Data Augmentation Algorithm for Neural Machine Translation (EMNLP '18)IWSLT '15 en-vi, IWSLT '16 de-en, WMT '15 en-de
Generalizing Back-Translation in Neural Machine Translation (WMT '19)ed NewsCrawl2, WMT'18 de-en
Neural Fuzzy Repair: Integrating Fuzzy Matches into Neural Machine Translation (ACL '19)DGT-TM en-ml/en-hu
Augmenting Neural Machine Translation with Knowledge Graphs (arxiv '19)WMT '14 -'18
Generalized Data Augmentation for Low-Resource Translation (ACL '19) codeENG-HRL-LRL, HRL-LRL
Improving Robustness of Machine Translation with Synthetic Noise (NAACL '19) codeEP, TED, MTNT en-fr en-jpn
Soft Contextual Data Augmentation for Neural Machine Translation (ACL '19) codeIWSLT '14 de/es/he-en, WMT '14 en-de
Data augmentation using back-translation for context-aware neural machine translation (DiscoMT @ EMNLP '19) codeIWSLT'17 en-ja/en-fr, BookCorpus, Europarl v7, National Diet of Japan
Improving Neural Machine Translation Robustness via Data Augmentation: Beyond Back-Translation (W-NUT @ EMNLP '19)WMT'15/'19 en/fr, MTNT, IWSLT'17, MuST-C
Data augmentation for pipeline-based speech translation (Baltic HLT '20)WMT '17
Lexical-Constraint-Aware Neural Machine Translation via Data Augmentation (IJCAI '20) codeWMT '16 de-en, NIST zh-en
A Diverse Data Augmentation Strategy for Low-Resource Neural Machine Translation (Information '20)IWSLT '14 en-de
Syntax-aware Data Augmentation for Neural Machine Translation (arxiv '20)WMT '14 en-de, IWSLT '14 de-en
SSMBA: Self-Supervised Manifold Based Data Augmentation for Improving Out-of-Domain Robustness (EMNLP '20) codeIWSLT'14
Data diversification: A simple strategy for neural machine translation (NeurIPS '20) codeWMT '14 en-de/en-fr, IWSLT '13/'14/'15 en-de/de-en/en-fr
AdvAug: Robust Adversarial Augmentation for Neural Machine Translation (ACL '20)NIST zh-en, WMT '14 en-de
Dictionary-based Data Augmentation for Cross-Domain Neural Machine Translation (arxiv '20)WMT '14/'19
Sentence Boundary Augmentation For Neural Machine Translation Robustness (arxiv '20)IWSLT '14/'15/'18 en-de, WMT '18 en-de
Valar nmt : Vastly lacking resources neural machine translation (Stanford CS224N)Bible, Misc, Europarl v8, Newstest '18

Summarization

PaperDatasets
Transforming Wikipedia into Augmented Data for Query-Focused Summarization (arxiv '19)DUC
Iterative Data Augmentation with Synthetic Data (Abstract Text Summarization: A Low Resource Challenge (EMNLP '19)Swisstext, commoncrawl
Improving Zero and Few-Shot Abstractive Summarization with Intermediate Fine-tuning and Data Augmentation (NAACL '21)CNN-DailyMail
Data Augmentation for Abstractive Query-Focused Multi-Document Summarization (AAAI '21) codeQMDSCNN, QMDSIR, WikiSum, DUC 2006, DUC 2007

Question Answering

PaperDatasets
QANet: Combining Local Convolution with Global Self-Attention for Reading Comprehension (ICLR '18)SQuAD, TriviaQA
An Exploration of Data Augmentation and Sampling Techniques for Domain-Agnostic Question Answering (EMNLP '19 Workshop)MRQA
Data Augmentation for BERT Fine-Tuning in Open-Domain Question Answering (arxiv '19)SQuAD, Trivia-QA, CMRC, DRCD
XLDA: Cross-Lingual Data Augmentation for Natural Language Inference and Question Answering (arxiv '19)XNLI, SQuAD
Synthetic Data Augmentation for Zero-Shot Cross-Lingual Question Answering (arxiv '20)MLQA, XQuAD, SQuAD-it, PIAF
Logic-Guided Data Augmentation and Regularization for Consistent Question Answering (ACL '20) codeWIQA, QuaRel, HotpotQA

Sequence Tagging

PaperDatasets
Data Augmentation via Dependency Tree Morphing for Low-Resource Languages (EMNLP '18) codeuniversal dependencies project
DAGA: Data Augmentation with a Generation Approach for Low-resource Tagging Tasks (EMNLP '20) codeCoNLL2002/2003
An Analysis of Simple Data Augmentation for Named Entity Recognition (COLING '20)MaSciP, i2b2- 2010
SeqMix: Augmenting Active Sequence Labeling via Sequence Mixup (EMNLP '20) codeCoNLL-03, ACE05, Webpage

Parsing

PaperDatasets
Data Recombination for Neural Semantic Parsing (ACL '16) codeGeoQuery, ATIS, Overnight
A systematic comparison of methods for low-resource dependency parsing on genuinely low-resource languages (EMNLP '19)Universal Dependencies treebanks version 2.2
Named Entity Recognition for Social Media Texts with Semantic Augmentation (EMNLP '20)codeWNUT16, WNUT17, Weibo
Good-Enough Compositional Data Augmentation (ACL '20) codeSCAN
GraPPa: Grammar-Augmented Pre-Training for Table Semantic Parsing (ICLR '21)SPIDER, WIKISQL, WIKITABLEQUESTIONS

Grammatical Error Correction

PaperDatasets
GenERRate: Generating Errors for Use in Grammatical Error Detection (BEA '09)Ungram-BNC
Mining Revision Log of Language Learning SNS for Automated Japanese Error Correction of Second Language Learners (IJCNLP '11) codeLang-8
Artificial error generation for translation-based grammatical error correction (University of Cambridge Technical Report '16)Several Datasets
Noising and Denoising Natural Language: Diverse Backtranslation for Grammar Correction. (NAACL'18)Lang-8, CoNLL-2014, CoNLL-2013, JFLEG
Using Wikipedia Edits in Low Resource Grammatical Error Correction. (WNUT @ EMNLP '18)Falko-MERLIN GEC Corpus
Sequence-to-sequence Pre-training with Data Augmentation for Sentence Rewriting (arxiv '19)CoNLL-2014 , JFLEG
Controllable Data Synthesis Method for Grammatical Error Correction (arxiv '19) codeNUCLE, Lang-8, One-Billion, CoNLL2013, CoNLL2014
Neural Grammatical Error Correction Systems with Unsupervised Pre-training on Synthetic Data. (BEA @ ACL '19)FCE, NUCLE, W&I+LOCNESS, Lang-8
Corpora Generation for Grammatical Error Correction (NAACL'19)CoNLL-2014, JFLEG, Lang-8
Erroneous data generation for Grammatical Error Correction (BEA @ ACL '19)Lang-8,n CoNLL, JFLEG, CoNLL-2014, ABCN, FCE
Sequence-to-sequence Pre-training with Data Augmentation for Sentence Rewriting (arxiv '19) codeGYAFC, WMT14, WMT18
A neural grammatical error correction system built on better pre-training and sequential transfer learning. (BEA @ ACL '19)FCE, NUCLE, W&I+LOCNESS, Lang-8, Gutenberg, Tatoeba, WikiText-103
Improving Grammatical Error Correction with Data Augmentation by Editing Latent Representation (COLING'20)FCE, NUCLE, W&I+LOCNESS, Lang-8
A Comparative Study of Synthetic Data Generation Methods for Grammatical Error Correction (BEA @ ACL '20)W&I+LOCNESS, FCE, News Crawl 2, W&I+L train, FCE-train, NUCLE, Lang-8, W&I+L dev, FCE-test, Tatoeba, WikiText-103
A syntactic rule-based framework for parallel data synthesis in Japanese GEC (MIT Thesis '20)Lang-8

Generation

PaperDatasets
TNT-NLG, System 2: Data repetition and meaning representation manipulation to improve neural generation (E2E NLG Challenge System Descriptions)TODO
Findings of the Third Workshop on Neural Generation and Translation (WNGT @ EMNLP '19)RotoWire English-German
A Good Sample is Hard to Find: Noise Injection Sampling and Self-Training for Neural Language Generation Models (INLG '19) codeE2E Challenge Dataset, Laptops, TVs
GenAug: Data Augmentation for Finetuning Text Generators (DeeLIO @ EMNLP '20) codeYelp
Denoising Pre-Training and Data Augmentation Strategies for Enhanced RDF Verbalization with Transformers (WebNLG+ @ INLG '20)WebNLG

Dialogue

PaperDatasets
Sequence-to-Sequence Data Augmentation for Dialogue Language Understanding (COLING '18) codeATIS, Dec94, Stanford dialogue
Task-Oriented Dialog Systems that Consider Multiple Appropriate Responses under the Same Context (arxiv '19) codeMultiWOZ
Data Augmentation by Data Noising for Open-vocabulary Slots in Spoken Language Understanding (Student Research Workshop @ NAACL '19)ATIS, Snips, MR
Data Augmentation with Atomic Templates for Spoken Language Understanding (EMNLP '19) codeDSTC 2&3, DSTC2
Data Augmentation for Spoken Language Understanding via Joint Variational Generation (AAAI '19)ATIS, Snips, MIT
Effective Data Augmentation Approaches to End-to-End Task-Oriented Dialogue (IALP '19)CamRest676, KVRET
Paraphrase Augmented Task-Oriented Dialog Generation (ACL '20) codeTCamRest676, MultiWOZ
Dialog State Tracking with Reinforced Data Augmentation (AAAI '20)WoZ, MultiWoZ
Data Augmentation for Copy-Mechanism in Dialogue State Tracking (arxiv '20)WoZ, DSTC2, Multi
Simple is Better! Lightweight Data Augmentation for Low Resource Slot Filling and Intent Classification (PACLIC '20) codeATIS, SNIPS, FB
Conversation Graph: Data Augmentation, Training, and Evaluation for Non-Deterministic Dialogue Management (TACL '21)M2M, MultiWOZ
Improving Automated Evaluation of Open Domain Dialog via Diverse Reference Augmentation (ACL '21 Findings) codeDailyDialog

Multimodal

PaperDatasets
Data Augmentation for Visual Question Answering (INLG '17)COCO-VQA, COCO-QA
Low Resource Multi-modal Data Augmentation for End-to-end ASR (CoRR ’18)TODO
Multi-Modal Data Augmentation for End-to-end ASR (Interspeech '18)Voxforge, HUB4
Augmenting Image Question Answering Dataset by Exploiting Image Captions (LREC '18)IQA
Multimodal Continuous Emotion Recognition with Data Augmentation Using Recurrent Neural Networks (AVEC '18)TODO
Multimodal Dialogue State Tracking By QA Approach with Data Augmentation (DSTC8 @ AAAI '20)DSTC7-AVSD
Data augmentation techniques for the Video Question Answering task (arxiv '20)TGIF-QA, MSVD-QA
Data Augmentation for Training Dialog Models Robust to Speech Recognition Errors (NLP for ConvAI @ ACL '20)DSTC2
Semantic Equivalent Adversarial Data Augmentation for Visual Question Answering (ECCV '20)TODO
Text Augmentation Using BERT for Image Captioning (Applied Sciences '20)MSCOCO
MDA: Multimodal Data Augmentation Framework for Boosting Performance on Image-Text Sentiment/Emotion Classification Tasks (IEEE Intelligent Systems '20)TODO

Mitigating Bias

PaperDatasets
Gender Bias in Coreference Resolution: Evaluation and Debiasing Methods. (NAACL '18) codeWinoBias, OntoNotes
Counterfactual Data Augmentation for Mitigating Gender Stereotypes in Languages with Rich Morphology (ACL '19) codeTODO
CONAN - COunter NArratives through Nichesourcing: a Multilingual Dataset of Responses to Fight Online Hate Speech (ACL '19) DatasetNew Dataset Created
It’s All in the Name: Mitigating Gender Bias with Name-Based Counterfactual Data Substitution (EMNLP '19) codeSSA, Stanford Large Movie Review, SimLex-999
Gender Bias in Neural Natural Language Processing. (Springer '20)Wikitext-2, CoNLL-2012
Improving Robustness by Augmenting Training Sentences with Predicate-Argument Structures (arxiv '20)SWAG, CoNLL2009, MultiNLI, HANS

Mitigating Class Imbalance

PaperDatasets
SMOTE: Synthetic Minority Over-sampling Technique (Journal of Artificial Intelligence Research '02)Pima, Phoneme, Adult, E-state, Satimage, Forest Cover, Oil, Mammography, Can
Active Learning for Word Sense Disambiguation with Methods for Addressing the Class Imbalance Problem (EMNLP '07)TODO
MLSMOTE: Approaching imbalanced multilabel learning through synthetic instance generation (Knowledge-Based Systems '15)bibtex, cal500, corel5k, slashdot, tmc2007, mediamill, medical, scene, enron, emotions
SMOTE for Learning from Imbalanced Data: Progress and Challenges, Marking the 15-year Anniversary (Journal of Artificial Intelligence Research '18)TODO

Adversarial examples

PaperDatsets
Adversarial Example Generation with Syntactically Controlled Paraphrase Networks (NAACL '18) codeSST, SICK
AdvEntuRe: Adversarial Training for Textual Entailment with Knowledge-Guided Examples (ACL '18) codeWordNet, PPDB, SICK, SNLI, SciTail
Breaking NLI Systems with Sentences that Require Simple Lexical Inferences (ACL '18)SNLI, SciTail, MultiNLI
Certified Robustness to Adversarial Word Substitutions (EMNLP '19) codeIMDB, SNLI
PAWS: Paraphrase Adversaries from Word Scrambling (NAACL '19) codePAWS (QQP + Wikipedia)
Generating Natural Language Adversarial Examples through Probability Weighted Word Saliency (ACL '19) codeIMDB, AG’s News, Yahoo Answers

Compositionality

PaperDatsets
Good-Enough Compositional Data Augmentation (ACL '20) codeSCAN
Sequence-Level Mixed Sample Data Augmentation (EMNLP '20) codeIWSLT ’14, WMT ’14

Automated Augmentation

PaperDatsets
Learning Data Manipulation for Augmentation and Weighting (NeurIPS '19) codeSST, IMDB, TREC, CIFAR-10
Data Manipulation: Towards Effective Instance Learning for Neural Dialogue Generation via Learning to Augment and Reweight (ACL '20)DailyDialog, OpenSubtitles
Text AutoAugment: Learning Compositional Augmentation Policy for Text Classification (EMNLP '21) codeIMDB, SST2, SST5, TREC, YELP2, YELP5

Popular Resources


from https://github.com/styfeng/DataAug4NLP