网站建设与维护泰安网站建设

杭州边趣网络技术有限公司 2026/09/09 19:48:24

论文网址:[1802.05695] Explainable Prediction of Medical Codes from Clinical Text

论文代码:GitHub - jamesmullenbach/caml-mimic: multilabel classification of EHR notes

目录

1. 心得

2. 论文逐段精读

2.1. Abstract

2.2. Introduction

2.3. Method

2.3.1. Convolutional architecture

2.3.2. Attention

2.3.3. Classification

2.3.4. Training

2.3.5. Embedding label descriptions

2.4. Evaluation of code prediction

2.4.1. Datasets

2.4.2. Systems

2.4.3. Evaluation Metrics

2.4.4. Results

2.5. Evaluation of Interpretability

2.5.1. Extracting informative text snippets

2.5.2. Results

2.6. Related Work

2.7. Conclusions and Future Work

1. 心得

(1)是数据划分得很好吗?

2. 论文逐段精读

2.1. Abstract

①文本和标签之间没有直接的对间联系,使得分类很难很杂乱

2.2. Introduction

①ICD分类难点:标签空间大、写作风格不统一

②作者提出Convolutional Attention for Multi-Label classification (CAML)

taxonomy n.分类法;分类学;分类系统

2.3. Method

①ICD编码设为

②对每个标签需要去分类这个样本,其中

2.3.1. Convolutional architecture

①临床文本嵌入:,其中是文本长度

②对每个单词嵌入使用卷积

其中是选择卷积的token/words数,是输入的文本嵌入隐藏层维度,是输出的文本嵌入隐藏层维度,*是卷积操作,逐元素非线性变换,是偏置。作者padding了一下所以输出是

2.3.2. Attention

实际上是一个-gram的文本特征

②计算文本特征和标签特征的矩阵乘积:

其中是标签的特征

③归一化:

④每个标签的表示:

⑤文档级特征嵌入:

2.3.3. Classification

①对于文档级特征嵌入使用线性层分类:

其中是权重向量,是偏置标量

②模型设计:

2.3.4. Training

①交叉熵损失:

对权重使用L2正则以及使用Adam优化器

2.3.5. Embedding label descriptions

①I表示相关,HI表示高相关,CAML总是能抓住比较相关的文本:

②另一个约束项variant Description Regularized CAML(DR-CAML),让可学习向量的特征和描述文本特征(从WHO中得到)相近:

2.4. Evaluation of code prediction

2.4.1. Datasets

①MIMIC III:有8921个标签,其中6918是疾病,2003是操作

②按被试ID划分,同一个被试的多次住院不会被同时分进训练集/验证集/测试集

③数据集:MIMIC III full,MIMIC III 50,MIMIC II:

④数据预处理:移除不包含字母的文本(如500被移除但是500mg保留),将所有字母小写,⭐把整个数据集出现小于三个文档的token标记为UNK

⑤预训练文本嵌入模型word2vec CBOW,维度为

⑥所有诊断记录被截断为2500个token

addendum n.补遗;(尤指书籍的)补篇

2.4.2. Systems

①超参数设置:

调参是通过Spearmint Bayesian optimization pack age做到的

2.4.3. Evaluation Metrics

①列举一些评估指标

2.4.4. Results

①MIMIC III full上的对比实验:

②MIMIC III 50上的对比实验:

③MIMIC II full上的对比实验:

2.5. Evaluation of Interpretability

2.5.1. Extracting informative text snippets

①描述了对于不同模型怎么提取标签对应的n-gram

2.5.2. Results

①请专家评估100次预测中标签和n-gram的对应程度:

2.6. Related Work

①列举CNN、LSTM、RNN等方法

2.7. Conclusions and Future Work

~

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈,一经查实,立即删除!

黄石网站建设东莞网站建设公司

Excalidraw 支持导入/导出 JSON 实现数据迁移在远程协作日益成为常态的今天,团队对可视化工具的需求早已超越了“画图”本身。工程师、产品经理和设计师们需要一种既能快速表达想法

2026/06/30 10:36:21

网站建设论坛网站建设项目

观点作者:科易网AI+技术转移研究院随着科技创新驱动发展战略的深入推进,高校院所作为科技成果的重要源头,其成果转化效率与服务能力面临新的挑战。在政策环

2026/06/30 10:33:51

网站建设技术团购网站建设

大家好,我是java1234_小锋老师,看到一个不错的基于Python的Flask+Vue3在线图书(图书借阅)管理系统【论文+源码+SQL脚本】&

2026/06/30 12:02:29

中国建设银行网站网站建设团队

PyTorch-CUDA-v2.9 镜像中 Jupyter Lab 的完整使用实践在深度学习项目开发中,最让人头疼的往往不是模型设计本身,而是环境配置——“为什么代码在我机

2026/06/30 13:44:07

广州市网站建设旅游网站建设方案

Langchain-Chatchat 的自动纠错能力:让私有知识库更懂“人话”在企业部署智能问答系统的实践中,一个看似微小却频繁发生的痛点常常被低估:用户输入

2026/06/30 11:50:27

陕西网站建设巩义网站建设

还在为斗地主游戏中的复杂局面困惑吗?🤔 AI斗地主助手来了!这款基于深度强化学习技术的智能工具,能够帮你分析局势、提供出牌策略建议࿰

2026/06/30 10:41:21

绵阳网站建设随州网站建设

还在为B站硬核会员的100道专业题目而苦恼?今天我们将深入剖析一款革命性的AI自动答题工具,从技术原理到实战应用,为您提供完整的解决方案。【免费下载链接】bi

2026/06/30 12:08:29

建设部网站江苏省建设厅网站

第一章:JDK 23类文件操作技术概述JDK 23 提供了更加高效和安全的文件操作 API,极大简化了开发者对本地文件系统进行读写、监控与管理的工作。通过 `jav

2026/06/30 13:59:08

辽宁网站建设上海网站建设的

本文讨论了深度学习中常用的损失函数,包括交叉熵损失函数、余弦相似度损失函数和双曲余弦对数损失函数,并对它们在PyTorch中的应用细节进行了介绍,通过MNIS

2026/06/30 12:24:01