TensorFlow模型的保存與恢復加載

近期做了一些反垃圾的工作,除了使用常用的規則匹配過濾等手段,也采用了一些機器學習方法進行分類預測。我們使用TensorFlow進行模型的訓練,訓練好的模型需要保存,預測階段我們需要將模型進行加載還原使用,這就涉及TensorFlow模型的保存與恢復加載。

總結一下Tensorflow常用的模型保存方式。

保存checkpoint模型文件(.ckpt)

首先,TensorFlow提供了一個非常方便的api,tf.train.Saver()來保存和還原一個機器學習模型。

模型保存

使用tf.train.Saver()來保存模型文件非常方便,下面是一個簡單的例子:

import tensorflow as tf
import os

def save_model_ckpt(ckpt_file_path):
    x = tf.placeholder(tf.int32, name='x')
    y = tf.placeholder(tf.int32, name='y')
    b = tf.Variable(1, name='b')
    xy = tf.multiply(x, y)
    op = tf.add(xy, b, name='op_to_store')

    sess = tf.Session()
    sess.run(tf.global_variables_initializer())

    path = os.path.dirname(os.path.abspath(ckpt_file_path))
    if os.path.isdir(path) is False:
        os.makedirs(path)

    tf.train.Saver().save(sess, ckpt_file_path)
    
    # test
    feed_dict = {x: 2, y: 3}
    print(sess.run(op, feed_dict))

程序生成并保存四個文件(在版本0.11之前只會生成三個文件:checkpoint, model.ckpt, model.ckpt.meta)

  • checkpoint 文本文件,記錄了模型文件的路徑信息列表
  • model.ckpt.data-00000-of-00001 網絡權重信息
  • model.ckpt.index .data和.index這兩個文件是二進制文件,保存了模型中的變量參數(權重)信息
  • model.ckpt.meta 二進制文件,保存了模型的計算圖結構信息(模型的網絡結構)protobuf

以上是tf.train.Saver().save()的基本用法,save()方法還有很多可配置的參數:

tf.train.Saver().save(sess, ckpt_file_path, global_step=1000)

加上global_step參數代表在每1000次迭代后保存模型,會在模型文件后加上"-1000",model.ckpt-1000.index, model.ckpt-1000.meta, model.ckpt.data-1000-00000-of-00001

每1000次迭代保存一次模型,但是模型的結構信息文件不會變,就只用1000次迭代時保存一下,不用相應的每1000次保存一次,所以當我們不需要保存meta文件時,可以加上write_meta_graph=False參數,如下:

tf.train.Saver().save(sess, ckpt_file_path, global_step=1000, write_meta_graph=False)

如果想每兩小時保存一次模型,并且只保存最新的4個模型,可以加上使用max_to_keep(默認值為5,如果想每訓練一個epoch就保存一次,可以將其設置為None或0,但是沒啥用不推薦), keep_checkpoint_every_n_hours參數,如下:

tf.train.Saver().save(sess, ckpt_file_path, max_to_keep=4, keep_checkpoint_every_n_hours=2)

同時在tf.train.Saver()類中,如果我們不指定任何信息,則會保存所有的參數信息,我們也可以指定部分想要保存的內容,例如只保存x, y參數(可傳入參數list或dict):

tf.train.Saver([x, y]).save(sess, ckpt_file_path)

ps. 在模型訓練過程中需要在保存后拿到的變量或參數名屬性name不能丟(op = tf.add(xy, b, name='op_to_store')),不然模型還原后不能通過get_tensor_by_name()獲取。

模型加載還原

針對上面的模型保存例子,還原模型的過程如下:

import tensorflow as tf

def restore_model_ckpt(ckpt_file_path):
    sess = tf.Session()
    saver = tf.train.import_meta_graph('./ckpt/model.ckpt.meta')  # 加載模型結構
    saver.restore(sess, tf.train.latest_checkpoint('./ckpt'))  # 只需要指定目錄就可以恢復所有變量信息

    # 直接獲取保存的變量
    print(sess.run('b:0'))

    # 獲取placeholder變量
    input_x = sess.graph.get_tensor_by_name('x:0')
    input_y = sess.graph.get_tensor_by_name('y:0')
    # 獲取需要進行計算的operator
    op = sess.graph.get_tensor_by_name('op_to_store:0')

    # 加入新的操作
    add_on_op = tf.multiply(op, 2)

    ret = sess.run(add_on_op, {input_x: 5, input_y: 5})
    print(ret)

首先還原模型結構,然后還原變量(參數)信息,最后我們就可以獲得已訓練的模型中的各種信息了(保存的變量、placeholder變量、operator等),同時可以對獲取的變量添加各種新的操作(見以上代碼注釋)。

并且,我們也可以加載部分模型,在此基礎上加入其它操作,具體可以參考官方文檔和demo。

針對ckpt模型文件的保存與還原,stackoverflow上有一個回答解釋比較清晰,可以參考。

同時cv-tricks.com上面的TensorFlow模型保存與恢復的教程也非常好,可以參考。

《tensorflow 1.0 學習:模型的保存與恢復(Saver)》有一些Saver使用技巧。

保存單個模型文件(.pb)

我自己運行過Tensorflow的inception-v3的demo,發現運行結束后會生成一個.pb的模型文件,這個文件是作為后續預測或遷移學習使用的,就一個文件,非常炫酷,也十分方便。

這個過程的主要思路是graph_def文件中沒有包含網絡中的Variable值(通常情況存儲了權重),但是卻包含了constant值,所以如果我們能把Variable轉換為constant(使用graph_util.convert_variables_to_constants()函數),即可達到使用一個文件同時存儲網絡架構與權重的目標。

ps:這里.pb是模型文件的后綴名,當然我們也可以用其它的后綴(使用.pb與google保持一致 ╮(╯▽╰)╭)

模型保存

同樣根據上面的例子,一個簡單的demo:

import tensorflow as tf
import os
from tensorflow.python.framework import graph_util

def save_mode_pb(pb_file_path):
    x = tf.placeholder(tf.int32, name='x')
    y = tf.placeholder(tf.int32, name='y')
    b = tf.Variable(1, name='b')
    xy = tf.multiply(x, y)
    # 這里的輸出需要加上name屬性
    op = tf.add(xy, b, name='op_to_store')

    sess = tf.Session()
    sess.run(tf.global_variables_initializer())

    path = os.path.dirname(os.path.abspath(pb_file_path))
    if os.path.isdir(path) is False:
        os.makedirs(path)

    # convert_variables_to_constants 需要指定output_node_names,list(),可以多個
    constant_graph = graph_util.convert_variables_to_constants(sess, sess.graph_def, ['op_to_store'])
    with tf.gfile.FastGFile(pb_file_path, mode='wb') as f:
        f.write(constant_graph.SerializeToString())

    # test
    feed_dict = {x: 2, y: 3}
    print(sess.run(op, feed_dict))

程序生成并保存一個文件

  • model.pb 二進制文件,同時保存了模型網絡結構和參數(權重)信息

模型加載還原

針對上面的模型保存例子,還原模型的過程如下:

import tensorflow as tf
from tensorflow.python.platform import gfile

def restore_mode_pb(pb_file_path):
    sess = tf.Session()
    with gfile.FastGFile(pb_file_path, 'rb') as f:
        graph_def = tf.GraphDef()
        graph_def.ParseFromString(f.read())
        sess.graph.as_default()
        tf.import_graph_def(graph_def, name='')

    print(sess.run('b:0'))

    input_x = sess.graph.get_tensor_by_name('x:0')
    input_y = sess.graph.get_tensor_by_name('y:0')

    op = sess.graph.get_tensor_by_name('op_to_store:0')

    ret = sess.run(op, {input_x: 5, input_y: 5})
    print(ret)

模型的還原過程與checkpoint差不多一樣。

CSDN《將TensorFlow的網絡導出為單個文件》上介紹了TensorFlow保存單個模型文件的方式,大同小異,可以看看。

思考

模型的保存與加載只是TensorFlow中最基礎的部分之一,雖然簡單但是也必不可少,在實際運用中還需要注意模型何時保存,哪些變量需要保存,如何設計加載實現遷移學習等等問題。

同時TensorFlow的函數和類都在一直變化更新,以后也有可能出現更豐富的模型保存和還原的方法。

選擇保存為checkpoint或單個pb文件視業務情況而定,沒有特別大的差別。checkpoint保存感覺會更加靈活一些,pb文件更適合線上部署吧(個人看法)。

以上完整代碼:github


2017/11/25 done

此文章也同步至個人Github博客

最后編輯于
?著作權歸作者所有,轉載或內容合作請聯系作者
平臺聲明:文章內容(如有圖片或視頻亦包括在內)由作者上傳并發布,文章內容僅代表作者本人觀點,簡書系信息發布平臺,僅提供信息存儲服務。

推薦閱讀更多精彩內容

  • 使用驗證集判斷模型效果 為了評測神經網絡模型在不同參數下的效果,一般會從訓練集中抽取一部分作為驗證數據。除了使用驗...
    Manfestain閱讀 668評論 0 0
  • 沉魚落雁發現,許多人有一個舊貨情節,喜歡做舊的物品,可不知道大家是否喜歡用舊了物品呢? 很多人都有一個舊貨市場的情...
    如釋筆記閱讀 371評論 0 0
  • 秋風秋雨送秋涼, 秋衣秋褲迎秋陽。 落英繽紛含秋意, 不見蕭瑟言秋殤。 ——村姑的班車日記
    俏村姑閱讀 122評論 0 0
  • 日頭出來點點紅 照進妹房米海空。 米海越空越好耍, 只愁命短不愁窮。 第一次在某平臺網站上看到這部電影時上映時,被...
    猴子_2e4c閱讀 299評論 0 0
  • 夠了,別吵了,木小小蹲在地上哭著說 洛陽和小七看著木小小心里不是滋味 小七,木小小的死黨兼閨蜜 洛陽,木小小的正牌...
    15年墨墨閱讀 273評論 0 0