JavaScript
広告のノイズや余分なトークンなしで、任意のページをニューラルネットワークにフィードする方法
pullmdは、WebページをLLMエージェント向けのクリーンなMarkdownに変換します。広告やナビゲーションのノイズを取り除き、コンテンツ構造を保持しながらトークンを節約します。
言語
ホーム言語
セクション
pullmdは、WebページをLLMエージェント向けのクリーンなMarkdownに変換します。広告やナビゲーションのノイズを取り除き、コンテンツ構造を保持しながらトークンを節約します。
CCTモデルとONNX Runtimeを使用した軽量ライブラリ「fast-plate-ocr」による毎秒最大14,000枚のナンバープレート認識
乱雑なPDFやスキャンからAIを使って構造化JSONを抽出するNode.jsライブラリ。クラウドとローカルのビジョンモデルの両方をサポート。
Tesseract.jsがOCRをブラウザに直接お届け。バックエンド不要、クラウド利用料も不要——WebAssemblyによる純粋なクライアントサイドのテキスト認識。
PDFやスキャン文書からデータを抽出する必要はありませんか?Text-Extract-APIは、最新のOCRと言語モデルを組み合わせて、エレガントなソリューションを提供します。
PDF Craft – スキャンPDFを編集可能なMarkdownとEPUB形式に変換する強力なPythonツール。スマートOCR搭載。