通过辅助生成加速端到端PDF至Markdown的转换 (Accelerating End-to-End PDF to Markdown Conversion Through Assisted Generation) - 专知论文

会员服务 ·

0

Markdown · 解码 · 端到端 · GitHub · 数据转换 ·

Accelerating End-to-End PDF to Markdown Conversion Through Assisted Generation

翻译：通过辅助生成加速端到端PDF至Markdown的转换

from arxiv, Accepted NLDB 2025

Converting data from machine-unreadable formats like PDFs into Markdown has the potential to enhance the accessibility of scientific research. Existing end-to-end decoder transformer models can transform screenshots of PDFs into Markdown, offering more flexibility than pipeline-based methods. Yet, decoding text token by token from scratch is inefficient, especially when dense text can be directly copied from the PDF. To address this challenge, this paper modifies Prompt Lookup Decoding (PLD) to extract candidate sequences directly from PDF files, leveraging the high n-gram overlap between PDFs and their Markdown equivalents. A new method, Copy Lookup Decoding (CLD), is introduced here to enhance PLD's candidate generation mechanism. Experiments demonstrate that CLD can accelerate the conversion process by up to 1.70$\times$ at original quality. The codebase for this paper is open-source on GitHub (https://github.com/Fireblossom/CopyLookup).

翻译：将PDF等机器不可读格式的数据转换为Markdown，有望提升科学研究的可访问性。现有的端到端解码器Transformer模型能够将PDF截图转换为Markdown，相比基于流水线的方法提供了更高的灵活性。然而，从头开始逐词元解码文本效率低下，尤其是在密集文本可直接从PDF中复制的情况下。为应对这一挑战，本文修改了提示查找解码（PLD）方法，使其能够直接从PDF文件中提取候选序列，利用了PDF文件与其Markdown等价文本之间的高n元语法重叠度。本文引入了一种新方法——复制查找解码（CLD），以增强PLD的候选生成机制。实验表明，在保持原始质量的前提下，CLD可将转换过程加速高达1.70倍。本文的代码库已在GitHub上开源（https://github.com/Fireblossom/CopyLookup）。

0

相关内容

Markdown

Markdown 是一种轻量级的标记语言，可以用一些简单语法来表达一些富文本内容。

【CVPR2025】基于组合表示移植的图像编辑方法

【CVPR2025】基于组合表示移植的图像编辑方法

专知会员服务

8+阅读 · 4月5日

【AAAI2025】TimeDP：通过领域提示学习生成多领域时间序列

【AAAI2025】TimeDP：通过领域提示学习生成多领域时间序列

专知会员服务

14+阅读 · 1月10日

【CVPR2024】掩码自解码器是有效的多任务视觉通用模型

【CVPR2024】掩码自解码器是有效的多任务视觉通用模型

专知会员服务

20+阅读 · 2024年3月16日

【CVPR 2022】基于实例深度估计的统一深度感知全景分割 PanopticDepth: Per-Instance Depth Estimation for Unified Depth-Aware Panoptic Segmentation

【CVPR 2022】基于实例深度估计的统一深度感知全景分割 PanopticDepth: Per-Instance Depth Estimation for Unified Depth-Aware Panoptic Segmentation

专知会员服务

18+阅读 · 2022年3月19日

【WWW2021】归一化硬样本挖掘的双重注意匹配网络

【WWW2021】归一化硬样本挖掘的双重注意匹配网络

专知会员服务

18+阅读 · 2021年3月31日

【NeurIPS2020-MIT】子图神经网络，Subgraph Neural Networks

【NeurIPS2020-MIT】子图神经网络，Subgraph Neural Networks

专知

38+阅读 · 2020年9月30日

字节跳动李航提出AMBERT！超越BERT！多粒度token预训练语言模型

字节跳动李航提出AMBERT！超越BERT！多粒度token预训练语言模型

专知

18+阅读 · 2020年8月31日

Python图像处理，366页pdf，Image Operators Image Processing in Python

Python图像处理，366页pdf，Image Operators Image Processing in Python

专知

15+阅读 · 2020年7月23日

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

专知

11+阅读 · 2020年3月17日

【NeurIPS2019】图变换网络：Graph Transformer Network

【NeurIPS2019】图变换网络：Graph Transformer Network

专知

245+阅读 · 2019年11月18日

基于图论方法的DNA序列编码研究

国家自然科学基金

2+阅读 · 2016年12月31日

基于DASH的交互式三维视频系统建模

国家自然科学基金

1+阅读 · 2015年12月31日

自由视点三维视频中纹理-深度图像联合建模及应用

国家自然科学基金

0+阅读 · 2015年12月31日

非局部总变差正则化图像恢复模型的快速子空间校正算法

国家自然科学基金

0+阅读 · 2014年12月31日

语义关联的地理视频数据自适应组织方法

国家自然科学基金

1+阅读 · 2014年12月31日

When F1 Fails: Granularity-Aware Evaluation for Dialogue Topic Segmentation

When F1 Fails: Granularity-Aware Evaluation for Dialogue Topic Segmentation

Arxiv

0+阅读 · 12月24日

Post-Processing Mask-Based Table Segmentation for Structural Coordinate Extraction

Arxiv

0+阅读 · 12月24日

SAEs Are Good for Steering -- If You Select the Right Features

Arxiv

0+阅读 · 12月22日

Smark: A Watermark for Text-to-Speech Diffusion Models via Discrete Wavelet Transform

Arxiv

0+阅读 · 12月21日

Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models

Arxiv

0+阅读 · 12月20日

VIP会员

文章信息

相关主题

相关VIP内容

【CVPR2025】基于组合表示移植的图像编辑方法

【CVPR2025】基于组合表示移植的图像编辑方法

专知会员服务

8+阅读 · 4月5日

【AAAI2025】TimeDP：通过领域提示学习生成多领域时间序列

【AAAI2025】TimeDP：通过领域提示学习生成多领域时间序列

专知会员服务

14+阅读 · 1月10日

【CVPR2024】掩码自解码器是有效的多任务视觉通用模型

【CVPR2024】掩码自解码器是有效的多任务视觉通用模型

专知会员服务

20+阅读 · 2024年3月16日

【CVPR 2022】基于实例深度估计的统一深度感知全景分割 PanopticDepth: Per-Instance Depth Estimation for Unified Depth-Aware Panoptic Segmentation

【CVPR 2022】基于实例深度估计的统一深度感知全景分割 PanopticDepth: Per-Instance Depth Estimation for Unified Depth-Aware Panoptic Segmentation

专知会员服务

18+阅读 · 2022年3月19日

【WWW2021】归一化硬样本挖掘的双重注意匹配网络

【WWW2021】归一化硬样本挖掘的双重注意匹配网络

专知会员服务

18+阅读 · 2021年3月31日

热门VIP内容

开通专知VIP会员享更多权益服务

【斯坦福博士论文】数据、决策与过度依赖：构建可信人工智能的核心挑战

《多域时代中维持弹性军事训练：挑战与机遇》

【AAAI2026】专家数量何为最优？面向混合专家模型的语义专业化优化研究

自进化人工智能体的全面综述：连接基础模型与终身自主智能系统的新范式

相关资讯

【NeurIPS2020-MIT】子图神经网络，Subgraph Neural Networks

【NeurIPS2020-MIT】子图神经网络，Subgraph Neural Networks

专知

38+阅读 · 2020年9月30日

字节跳动李航提出AMBERT！超越BERT！多粒度token预训练语言模型

字节跳动李航提出AMBERT！超越BERT！多粒度token预训练语言模型

专知

18+阅读 · 2020年8月31日

Python图像处理，366页pdf，Image Operators Image Processing in Python

Python图像处理，366页pdf，Image Operators Image Processing in Python

专知

15+阅读 · 2020年7月23日

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

【阿里巴巴-WWW2020】对抗性多模态表示学习的点击率预测，Adversarial Multimodal RL

专知

11+阅读 · 2020年3月17日

【NeurIPS2019】图变换网络：Graph Transformer Network

【NeurIPS2019】图变换网络：Graph Transformer Network

专知

245+阅读 · 2019年11月18日

相关论文

When F1 Fails: Granularity-Aware Evaluation for Dialogue Topic Segmentation

When F1 Fails: Granularity-Aware Evaluation for Dialogue Topic Segmentation

Arxiv

0+阅读 · 12月24日

Post-Processing Mask-Based Table Segmentation for Structural Coordinate Extraction

Arxiv

0+阅读 · 12月24日

SAEs Are Good for Steering -- If You Select the Right Features

Arxiv

0+阅读 · 12月22日

Smark: A Watermark for Text-to-Speech Diffusion Models via Discrete Wavelet Transform

Arxiv

0+阅读 · 12月21日

Adaptive-VoCo: Complexity-Aware Visual Token Compression for Vision-Language Models

Arxiv

0+阅读 · 12月20日

相关基金

基于图论方法的DNA序列编码研究

国家自然科学基金

2+阅读 · 2016年12月31日

基于DASH的交互式三维视频系统建模

国家自然科学基金

1+阅读 · 2015年12月31日

自由视点三维视频中纹理-深度图像联合建模及应用

国家自然科学基金

0+阅读 · 2015年12月31日

非局部总变差正则化图像恢复模型的快速子空间校正算法

国家自然科学基金

0+阅读 · 2014年12月31日

语义关联的地理视频数据自适应组织方法

国家自然科学基金

1+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员